idw - Informationsdienst
Wissenschaft
Neue Studie der Uni Mainz zeigt, dass Sprachmodelle Wörter in lokalen Varianten missinterpretieren
Wie gut verstehen Sprachmodelle den Mainzer Dialekt? Dieser Frage ist ein von der Johannes Gutenberg-Universität Mainz (JGU) geleitetes Forschungsteam erstmals nachgegangen. Meenzerisch prägt die regionale Sprachkultur bis heute und ist durch die Büttenreden der Mainzer Fastnacht auch bundesweit bekannt. Die Studienergebnisse, veröffentlicht im Rahmen der Language Resources and Evaluation Conference in Palma de Mallorca (LREC 2026), zeigen: Aktuelle KI-Modelle haben große Schwierigkeiten, den Dialekt korrekt zu verstehen.
"Sprachvarianten wie Meenzerisch sind ein wichtiger Teil kultureller Identität, verschwinden aber gleichzeitig aus dem alltäglichen Gebrauch", erklärt Minh Duc Bui vom Institut für Informatik der JGU, der die Studie zusammen mit Prof. Dr. Katharina von der Wense leitete. "In der digitalen Sprachforschung werden regionale Dialekte bisher kaum berücksichtigt. Dabei könnten gerade sprachtechnologische Werkzeuge helfen, sie sichtbarer zu machen und langfristig zu bewahren."
Maschinenlesbares Meenzerisch
Das Team, dem auch ein Forscher der Philipps-Universität Marburg angehörte, erstellte zunächst einen neuen Datensatz zum Mainzer Dialekt. Grundlage war ein Wörterbuch aus dem Jahr 1966, das die Forschenden digitalisierten. Daraus entstand ein maschinenlesbares Lexikon mit 2.351 Dialektwörtern und ihren Definitionen im Standarddeutschen. "Bislang fehlte es für Meenzerisch an genau solchen Ressourcen", so Prof. Dr. Katharina von der Wense, Leiterin der Arbeitsgruppe Sprachverarbeitung an der JGU.
Auf Basis des digitalen Lexikons konnten die Forschenden daraufhin erstmals systematisch untersuchen, wie gut große Sprachmodelle mit dem Dialekt umgehen können. Getestet wurden mehrere Open-Source-Sprachmodelle unterschiedlicher Größe. Diese mussten zum einen die Bedeutung von Meenzerisch-Wörtern erklären und zum anderen aus standarddeutschen Definitionen die passenden Dialektwörter erzeugen.
"Unsere Ergebnisse fallen deutlich aus", so Bui. "Die getesteten Modelle scheitern sowohl beim Verstehen als auch beim Produzieren des Dialekts." Beim Generieren von Wortdefinitionen erreichten sie im Durchschnitt eine Trefferquote von nur 4,24 Prozent. Auch die leistungsstärksten getesteten Modelle erzielten dabei nur sehr geringe Trefferquoten. Beim umgekehrten Test, also dem Erzeugen eines Dialektworts aus einer Definition, lag die Genauigkeit sogar nur bei 0,56 Prozent. Auch zusätzliche Hilfestellungen, etwa Beispiele im Prompt oder automatisch gewonnene Regeln, verbesserten die Ergebnisse kaum. Die Genauigkeit blieb in allen Fällen unter zehn Prozent.
Kleinere Sprachformen werden digital unsichtbar
"Die Resultate zeigen sehr klar, dass heutige Sprachmodelle Meenzerisch bislang kaum verstehen", sagt Ko-Autor Prof. Dr. Peter Herbert Kann von der Universität Marburg, der selbst den Mainzer Dialekt beherrscht. "Das ist aus technischer Sicht interessant, zeigt aber auch, wie schnell kleinere Sprachformen in digitalen Anwendungen unsichtbar werden können." Eine Ursache dafür könnte den Forschenden zufolge sein, dass Dialekte vor allem gesprochen werden und deshalb wenig Textdaten existieren.
"Langfristig brauchen wir Modelle, die nicht nur Standardsprachen, sondern auch regionale und kulturell bedeutsame Varietäten verarbeiten können", so Bui. Sprachtechnologien könnten demnach künftig helfen, Dialekte digital zu dokumentieren und zugänglich zu machen. Die von der Carl-Zeiss-Stiftung im Rahmen des interdisziplinären JGU-Forschungsprojekts "Trading off Non-Functional Properties of Machine Learning" (TOPML) geförderte aktuelle Studie sei dabei ein erster Schritt. "In Zukunft sind aber gezielte Datensätze und neue Trainingsansätze nötig, um sprachliche und kulturelle Vielfalt auch im digitalen Raum langfristig zu fördern."
Bildmaterial:
https://download.uni-mainz.de/presse/08_informatik_LLM_dialekte_meenzerisch_rach...
Das Wort „Rachebutzer“ in der Fehlinterpretation eines großen Sprachmodells (oben) und
in seiner Bedeutung im Mainzer Dialekt (unten).
Abb./©: Minh Duc Bui, erstellt mithilfe von Claude
Weiterführende Links:
• https://nala-cub.github.io/ – Arbeitsgruppe "Natural Language Processing" (NALA) von Prof. Dr. Katharina Wense
• https://www.informatik.uni-mainz.de/ – Institut für Informatik an der JGU
• https://topml.uni-mainz.de – Interdisziplinäres Forschungsprojekt "Trading Off Non-Functional Properties of Machine Learning" (TOPML) an der JGU
Lesen Sie mehr:
• https://presse.uni-mainz.de/ki-sprachmodelle-zeigen-vorurteile-gegen-regionale-d... – Pressemitteilung "KI-Sprachmodelle zeigen Vorurteile gegen regionale deutsche Sprachvarianten" (12.11.2025)
Juniorprof. Dr. Katharina von der Wense
Natural Language Processing (NALA)
Institut für Informatik
Johannes Gutenberg-Universität Mainz
55128 Mainz
E-Mail: k.vonderwense@uni-mainz.de
https://nala-cub.github.io/
Minh Duc Bui
Natural Language Processing
Institut für Informatik
Johannes Gutenberg-Universität Mainz
55128 Mainz
E-Mail: minhducbui@uni-mainz.de
https://www.datamining.informatik.uni-mainz.de/minh-duc-bui/
M. D. Bui et al., Meenz bleibt Meenz, but Large Language Models Do Not Speak Its Dialect, Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), Mai 2026,
DOI: 10.63317/4foh8f7kygj8
https://lrec.elra.info/lrec2026-main-258
Das Wort "Rachebutzer" in der Fehlinterpretation eines großen Sprachmodells (oben) und in seiner Bed ...
Copyright: © Minh Duc Bui, erstellt mithilfe von Claude
Merkmale dieser Pressemitteilung:
Journalisten, jedermann
Informationstechnik, Kulturwissenschaften, Sprache / Literatur
überregional
Forschungsergebnisse, Wissenschaftliche Publikationen
Deutsch

Sie können Suchbegriffe mit und, oder und / oder nicht verknüpfen, z. B. Philo nicht logie.
Verknüpfungen können Sie mit Klammern voneinander trennen, z. B. (Philo nicht logie) oder (Psycho und logie).
Zusammenhängende Worte werden als Wortgruppe gesucht, wenn Sie sie in Anführungsstriche setzen, z. B. „Bundesrepublik Deutschland“.
Die Erweiterte Suche können Sie auch nutzen, ohne Suchbegriffe einzugeben. Sie orientiert sich dann an den Kriterien, die Sie ausgewählt haben (z. B. nach dem Land oder dem Sachgebiet).
Haben Sie in einer Kategorie kein Kriterium ausgewählt, wird die gesamte Kategorie durchsucht (z.B. alle Sachgebiete oder alle Länder).