Zum Inhalt springen
deep-dives · 3 min Lesezeit

arXiv zieht bei ungeprüften KI-Papers die Bremse

arXiv verschärft den Umgang mit KI-Slop. Belastbare Prüfung zählt damit mindestens so viel wie der Output.

arxiv ki-slop wissenschaft llm policy

TechCrunch berichtete am 16. Mai 2026, arXiv könne Autoren bei offensichtlich ungeprüften KI-generierten Einreichungen für ein Jahr sperren. Eine offizielle arXiv-Regel dazu liegt dem Artikel nicht vor. Der Fall dahinter zeigt trotzdem ein praktisches Problem: Ein Paper mit erfundenen Referenzen oder stehen gebliebenen Modellkommentaren wird durch flüssigen Stil nicht verlässlicher.

Für viele Fachgebiete ist arXiv ein schneller Weg in den wissenschaftlichen Umlauf, lange bevor ein Journal oder eine Konferenz entscheidet. Taucht dort ein fehlerhaftes Paper auf, kostet das andere Forschende Zeit und setzt falsche Spuren für weitere Recherche.

Die Grenze verläuft bei der Verantwortung

Die Berichte beschreiben kein pauschales Verbot von KI-Werkzeugen. Im Fokus stehen Einreichungen, bei denen ein Sprachmodell erkennbar Arbeit übernommen hat und niemand das Ergebnis kontrolliert hat. Erfundene Quellen, falsch zugeordnete Zitate oder stehen gebliebene Modellkommentare sind klare Warnzeichen.

Für Forschungs- und Redaktionsteams ist die Trennung brauchbar. Ein Agent darf Literatur vorsortieren, einen Entwurf gliedern oder Widersprüche markieren; vor der Veröffentlichung bleibt jedoch eine Person oder ein klar benanntes Team verantwortlich, das die Belege geprüft hat und für die zentralen Aussagen einsteht.

Für mich liegt darin der wichtige Punkt der Debatte: Die Herkunft eines Satzes ist zweitrangig, solange der Satz überprüfbar ist. Ein menschlich formulierter Fehler bleibt ein Fehler. Ein KI-generierter Fehler wird auch dann nicht besser, wenn der Text sauber klingt.

Halluzinierte Quellen beschädigen die Infrastruktur

Eine erfundene Referenz ist kein Grenzfall.

Sie macht die Prüfung eines Papers unnötig teuer und kann sich über Zitationsketten, Suchmaschinen und spätere Zusammenfassungen weiterverbreiten. Wer eine auffällige Einreichung prüft, muss nicht lückenlos nachweisen, welches Modell welchen Absatz erzeugt hat. Für eine Zurückweisung oder vertiefte Prüfung genügt bereits, dass Quellen nicht auffindbar sind, Zitate nicht passen oder Bearbeitungsreste im Text stehen.

Die Größenordnung ist inzwischen messbar. In einem arXiv-Preprint vom 8. Mai 2026 untersuchten Zhenyue Zhao und Koautoren nach eigenen Angaben 111 Millionen Referenzen aus 2,5 Millionen Arbeiten in arXiv, bioRxiv, SSRN und PubMed Central. Der Abstract nennt für 2025 eine konservative Schätzung von 146.932 halluzinierten Zitaten.

Aus dieser Zahl lässt sich keine einzelne Regelverletzung ableiten. Sie belegt jedoch, dass fehlerhafte Referenzen keine kuriose Ausnahme mehr sind: Sobald sie in große wissenschaftliche Datensätze gelangen, wird ihre Korrektur zur Infrastrukturarbeit für andere.

Agenten brauchen Prüfungen vor dem Publish-Button

Für automatisierte Workflows folgt daraus ein klarer Prüfweg. Vor der Veröffentlichung müssen Quellen abrufbar sein, Zitate sich im Original finden lassen und Platzhalter aus dem finalen Text verschwinden. Fachliche oder risikoreiche Behauptungen brauchen außerdem die Freigabe einer Person, die ihren Kontext beurteilen kann.

Diese Kontrollen entscheiden darüber, ob ein Agent für einen Veröffentlichungsprozess geeignet ist. Ein schneller Entwurf mit langem Kontext und vielen Tools hilft wenig, wenn niemand nachvollziehen kann, auf welcher Quelle eine Behauptung beruht.

Gerade bei wissenschaftlichen Texten genügt eine gute Zusammenfassung nicht. Ist eine DOI falsch oder verweist ein Paper auf eine nicht auffindbare Vorarbeit, beginnt die Fehlersuche bei den Menschen, die den Text lesen, begutachten oder darauf aufbauen.

Das ist vermeidbar.

Wichtigste Punkte

Die von TechCrunch berichtete mögliche Maßnahme markiert eine sinnvolle Grenze: Automatisierung kann helfen, ersetzt aber keine nachweisbare Kontrolle. Forschungs- und Redaktionsteams sollten Quellencheck, Zitatabgleich und Freigabe fest einplanen, bevor ein Text in einen professionellen Kontext gelangt.

Ein Publish-Button sollte mehr verlangen als einen flüssigen Text. Belege müssen existieren, die tragenden Aussagen nachvollziehbar sein und für Fehler braucht es einen benannten Korrekturweg. Erst dann wird aus KI-Output veröffentlichungsreife Arbeit.

Transparenz

agentenlog.de nutzt KI-Assistenz für Recherche, Struktur und Entwurf. Inhaltliche Auswahl, Einordnung und Veröffentlichung liegen redaktionell bei agentenlog.de; Quellen und Fakten werden vor Veröffentlichung automatisiert geprüft.