idw – Informationsdienst Wissenschaft

Nachrichten, Termine, Experten

Grafik: idw-Logo
Grafik: idw-Logo

idw - Informationsdienst
Wissenschaft

idw-Abo

idw-News App:

AppStore

Google Play Store



Instanz:
Teilen: 
18.05.2026 19:34

Künstliche Intelligenz versteht Mainzer Dialekt nicht

Kathrin Voigt Kommunikation und Medien
Johannes Gutenberg-Universität Mainz

    Neue Studie der Uni Mainz zeigt, dass Sprachmodelle Wörter in lokalen Varianten missinterpretieren

    Wie gut verstehen Sprachmodelle den Mainzer Dialekt? Dieser Frage ist ein von der Johannes Gutenberg-Universität Mainz (JGU) geleitetes Forschungsteam erstmals nachgegangen. Meenzerisch prägt die regionale Sprachkultur bis heute und ist durch die Büttenreden der Mainzer Fastnacht auch bundesweit bekannt. Die Studienergebnisse, veröffentlicht im Rahmen der Language Resources and Evaluation Conference in Palma de Mallorca (LREC 2026), zeigen: Aktuelle KI-Modelle haben große Schwierigkeiten, den Dialekt korrekt zu verstehen.

    "Sprachvarianten wie Meenzerisch sind ein wichtiger Teil kultureller Identität, verschwinden aber gleichzeitig aus dem alltäglichen Gebrauch", erklärt Minh Duc Bui vom Institut für Informatik der JGU, der die Studie zusammen mit Prof. Dr. Katharina von der Wense leitete. "In der digitalen Sprachforschung werden regionale Dialekte bisher kaum berücksichtigt. Dabei könnten gerade sprachtechnologische Werkzeuge helfen, sie sichtbarer zu machen und langfristig zu bewahren."

    Maschinenlesbares Meenzerisch

    Das Team, dem auch ein Forscher der Philipps-Universität Marburg angehörte, erstellte zunächst einen neuen Datensatz zum Mainzer Dialekt. Grundlage war ein Wörterbuch aus dem Jahr 1966, das die Forschenden digitalisierten. Daraus entstand ein maschinenlesbares Lexikon mit 2.351 Dialektwörtern und ihren Definitionen im Standarddeutschen. "Bislang fehlte es für Meenzerisch an genau solchen Ressourcen", so Prof. Dr. Katharina von der Wense, Leiterin der Arbeitsgruppe Sprachverarbeitung an der JGU.

    Auf Basis des digitalen Lexikons konnten die Forschenden daraufhin erstmals systematisch untersuchen, wie gut große Sprachmodelle mit dem Dialekt umgehen können. Getestet wurden mehrere Open-Source-Sprachmodelle unterschiedlicher Größe. Diese mussten zum einen die Bedeutung von Meenzerisch-Wörtern erklären und zum anderen aus standarddeutschen Definitionen die passenden Dialektwörter erzeugen.

    "Unsere Ergebnisse fallen deutlich aus", so Bui. "Die getesteten Modelle scheitern sowohl beim Verstehen als auch beim Produzieren des Dialekts." Beim Generieren von Wortdefinitionen erreichten sie im Durchschnitt eine Trefferquote von nur 4,24 Prozent. Auch die leistungsstärksten getesteten Modelle erzielten dabei nur sehr geringe Trefferquoten. Beim umgekehrten Test, also dem Erzeugen eines Dialektworts aus einer Definition, lag die Genauigkeit sogar nur bei 0,56 Prozent. Auch zusätzliche Hilfestellungen, etwa Beispiele im Prompt oder automatisch gewonnene Regeln, verbesserten die Ergebnisse kaum. Die Genauigkeit blieb in allen Fällen unter zehn Prozent.

    Kleinere Sprachformen werden digital unsichtbar

    "Die Resultate zeigen sehr klar, dass heutige Sprachmodelle Meenzerisch bislang kaum verstehen", sagt Ko-Autor Prof. Dr. Peter Herbert Kann von der Universität Marburg, der selbst den Mainzer Dialekt beherrscht. "Das ist aus technischer Sicht interessant, zeigt aber auch, wie schnell kleinere Sprachformen in digitalen Anwendungen unsichtbar werden können." Eine Ursache dafür könnte den Forschenden zufolge sein, dass Dialekte vor allem gesprochen werden und deshalb wenig Textdaten existieren.

    "Langfristig brauchen wir Modelle, die nicht nur Standardsprachen, sondern auch regionale und kulturell bedeutsame Varietäten verarbeiten können", so Bui. Sprachtechnologien könnten demnach künftig helfen, Dialekte digital zu dokumentieren und zugänglich zu machen. Die von der Carl-Zeiss-Stiftung im Rahmen des interdisziplinären JGU-Forschungsprojekts "Trading off Non-Functional Properties of Machine Learning" (TOPML) geförderte aktuelle Studie sei dabei ein erster Schritt. "In Zukunft sind aber gezielte Datensätze und neue Trainingsansätze nötig, um sprachliche und kulturelle Vielfalt auch im digitalen Raum langfristig zu fördern."

    Bildmaterial:
    https://download.uni-mainz.de/presse/08_informatik_LLM_dialekte_meenzerisch_rach...
    Das Wort „Rachebutzer“ in der Fehlinterpretation eines großen Sprachmodells (oben) und
    in seiner Bedeutung im Mainzer Dialekt (unten).
    Abb./©: Minh Duc Bui, erstellt mithilfe von Claude

    Weiterführende Links:
    https://nala-cub.github.io/ – Arbeitsgruppe "Natural Language Processing" (NALA) von Prof. Dr. Katharina Wense
    https://www.informatik.uni-mainz.de/ – Institut für Informatik an der JGU
    https://topml.uni-mainz.de – Interdisziplinäres Forschungsprojekt "Trading Off Non-Functional Properties of Machine Learning" (TOPML) an der JGU

    Lesen Sie mehr:
    https://presse.uni-mainz.de/ki-sprachmodelle-zeigen-vorurteile-gegen-regionale-d... – Pressemitteilung "KI-Sprachmodelle zeigen Vorurteile gegen regionale deutsche Sprachvarianten" (12.11.2025)


    Wissenschaftliche Ansprechpartner:

    Juniorprof. Dr. Katharina von der Wense
    Natural Language Processing (NALA)
    Institut für Informatik
    Johannes Gutenberg-Universität Mainz
    55128 Mainz
    E-Mail: k.vonderwense@uni-mainz.de
    https://nala-cub.github.io/

    Minh Duc Bui
    Natural Language Processing
    Institut für Informatik
    Johannes Gutenberg-Universität Mainz
    55128 Mainz
    E-Mail: minhducbui@uni-mainz.de
    https://www.datamining.informatik.uni-mainz.de/minh-duc-bui/


    Originalpublikation:

    M. D. Bui et al., Meenz bleibt Meenz, but Large Language Models Do Not Speak Its Dialect, Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), Mai 2026,
    DOI: 10.63317/4foh8f7kygj8
    https://lrec.elra.info/lrec2026-main-258


    Bilder

    Das Wort "Rachebutzer" in der Fehlinterpretation eines großen Sprachmodells (oben) und in seiner Bedeutung im Mainzer Dialekt (unten).
    Das Wort "Rachebutzer" in der Fehlinterpretation eines großen Sprachmodells (oben) und in seiner Bed ...

    Copyright: © Minh Duc Bui, erstellt mithilfe von Claude


    Merkmale dieser Pressemitteilung:
    Journalisten, jedermann
    Informationstechnik, Kulturwissenschaften, Sprache / Literatur
    überregional
    Forschungsergebnisse, Wissenschaftliche Publikationen
    Deutsch


     

    Hilfe

    Die Suche / Erweiterte Suche im idw-Archiv
    Verknüpfungen

    Sie können Suchbegriffe mit und, oder und / oder nicht verknüpfen, z. B. Philo nicht logie.

    Klammern

    Verknüpfungen können Sie mit Klammern voneinander trennen, z. B. (Philo nicht logie) oder (Psycho und logie).

    Wortgruppen

    Zusammenhängende Worte werden als Wortgruppe gesucht, wenn Sie sie in Anführungsstriche setzen, z. B. „Bundesrepublik Deutschland“.

    Auswahlkriterien

    Die Erweiterte Suche können Sie auch nutzen, ohne Suchbegriffe einzugeben. Sie orientiert sich dann an den Kriterien, die Sie ausgewählt haben (z. B. nach dem Land oder dem Sachgebiet).

    Haben Sie in einer Kategorie kein Kriterium ausgewählt, wird die gesamte Kategorie durchsucht (z.B. alle Sachgebiete oder alle Länder).