Genom-Sprachmodell
Trainier deine Lernmuskeln!
Mit Flash Cards, Quiz und mehr
LoslegenWir werden ihn in Kürze redaktionell checken.
Wir werden ihn in Kürze redaktionell checken.
Englisch: genomic language model, genome language model
Definition
Ein Genom-Sprachmodell, kurz gLM, ist ein auf biologischen Sequenzdaten trainiertes Sprachmodell, das Muster und Abhängigkeiten innerhalb von Nukleotidsequenzen erlernt. Genom-Sprachmodelle können unter anderem zur funktionellen Annotation von DNA-Sequenzen, zur Vorhersage von Varianteneffekten und zur Generierung neuer Nukleotidsequenzen eingesetzt werden.
Hintergrund
Genom-Sprachmodelle übertragen Prinzipien des maschinellen Lernens, die ursprünglich insbesondere für die Verarbeitung natürlicher Sprache entwickelt wurden, auf biologische Sequenzen. Dabei werden Nukleotide bzw. daraus gebildete Sequenzabschnitte als Informationseinheiten verarbeitet.
Die zugrunde liegende Annahme ist, dass biologische Sequenzen nicht zufällig aufgebaut sind, sondern komplexe statistische und funktionelle Abhängigkeiten enthalten. Durch das Training auf großen Mengen genomischer Sequenzdaten können Genom-Sprachmodelle solche Zusammenhänge erfassen, ohne dass sämtliche biologischen Regeln zuvor explizit vorgegeben werden müssen.
Der Begriff bezeichnet keine einheitliche Modellarchitektur. Neben Transformer-basierten Modellen kommen beispielsweise autoregressive Modelle und andere für lange Sequenzen optimierte Architekturen zum Einsatz.
Funktionsprinzip
Beim Training eines Genom-Sprachmodells werden große Mengen biologischer Sequenzdaten verarbeitet. Je nach Modell und Trainingsverfahren besteht die Aufgabe beispielsweise darin,
- maskierte Sequenzabschnitte vorherzusagen,
- das nächste Nukleotid bzw. den nächsten Sequenzabschnitt vorherzusagen oder
- eine für weitere Aufgaben nutzbare Repräsentation einer biologischen Sequenz zu erzeugen.
Auf diese Weise lernt das Modell statistische Regelmäßigkeiten biologischer Sequenzen. Dazu können beispielsweise konservierte Sequenzmotive, regulatorische Zusammenhänge und längerreichweitige Abhängigkeiten zwischen unterschiedlichen Sequenzabschnitten gehören.
Nach einem allgemeinen Vortraining kann ein Genom-Sprachmodell für bestimmte Aufgaben weitertrainiert bzw. angepasst werden.
Anwendung
Mögliche bzw. bereits untersuchte Anwendungsgebiete von Genom-Sprachmodellen sind unter anderem:
- funktionelle Annotation genomischer Sequenzen
- Vorhersage regulatorischer Sequenzeigenschaften
- Vorhersage der Auswirkungen genetischer Varianten
- Erkennung funktioneller Sequenzmotive
- vergleichende Genomanalyse
- Klassifikation biologischer Sequenzen
- Generierung synthetischer DNA-Sequenzen
- Design von Genen und regulatorischen Sequenzen
- generatives Design vollständiger Genome
Genom-Sprachmodelle werden damit sowohl für analytische als auch für generative Aufgaben eingesetzt.
Beispiele
Zu den bekannten Genom-Sprachmodellen bzw. Modellfamilien zählen unter anderem DNABERT, Nucleotide Transformer und Evo.
Ein besonders umfangreiches Modell ist Evo 2, das auf mehreren Billionen Nukleotiden aus Bakterien, Archaeen, Eukaryoten und Bakteriophagen trainiert wurde. Das Modell verarbeitet DNA auf Einzelnukleotid-Ebene und kann Sequenzkontexte von bis zu etwa einer Million Basen berücksichtigen.[1]
Generatives Genomdesign
Neben der Analyse vorhandener DNA können bestimmte Genom-Sprachmodelle neue Nukleotidsequenzen generieren. Dabei wird versucht, Sequenzen zu erzeugen, die zuvor erlernte biologische Gesetzmäßigkeiten berücksichtigen und bestimmte vorgegebene Eigenschaften aufweisen.
Ein wichtiger experimenteller Nachweis dieses Prinzips gelang mit dem generativen Design von Bakteriophagen. Dabei wurden die Genom-Sprachmodelle Evo 1 und Evo 2 verwendet und für Sequenzen aus der Klasse der Microviricetes (früher Familie Microviridae)[2] weitertrainiert. Als Designvorlage diente der lytische Bakteriophage ΦX174.
Aus den computergenerierten Sequenzen wurden 302 Kandidaten für die experimentelle Untersuchung ausgewählt. 285 dieser Genome konnten synthetisiert und assembliert werden. Bei 16 Kandidaten entstanden lebensfähige Bakteriophagen, die das Wachstum von Escherichia coli C hemmen konnten.
Einzelne generierte Phagen zeigten im experimentellen Vergleich eine höhere Fitness bzw. schnellere Lysekinetik als ΦX174. Darüber hinaus konnte ein Cocktail aus generierten Phagen im Labor drei zuvor erzeugte ΦX174-resistente E. coli-Stämme nach serieller Passage überwinden, während ΦX174 allein hierzu nicht in der Lage war.
Die Ergebnisse gelten als erster experimenteller Nachweis des generativen Designs vollständiger lebensfähiger Bakteriophagengenome mithilfe von Genom-Sprachmodellen.
Medizinische Bedeutung
Genom-Sprachmodelle könnten langfristig insbesondere für die Präzisionsmedizin, funktionelle Genomik und synthetische Biologie relevant werden. Ein mögliches Anwendungsgebiet ist die Entwicklung von Bakteriophagen mit gezielten Eigenschaften.
Dadurch könnten Genom-Sprachmodelle perspektivisch auch für die Phagentherapie von Bedeutung sein. Denkbar ist beispielsweise die computergestützte Entwicklung unterschiedlicher Phagenvarianten zur Bekämpfung bestimmter bakterieller Erreger oder zur Überwindung bakterieller Phagenresistenzen.
Die klinische Wirksamkeit KI-generierter Phagen ist bislang jedoch nicht belegt. Die bisher beschriebenen Ergebnisse beruhen auf experimentellen Modellsystemen und stellen keine etablierte therapeutische Anwendung dar.
Limitationen
Trotz ihrer Leistungsfähigkeit besitzen Genom-Sprachmodelle verschiedene Limitationen. Dazu zählen insbesondere:
- Abhängigkeit von Umfang und Qualität der Trainingsdaten
- begrenzte Interpretierbarkeit erlernter Repräsentationen
- Schwierigkeiten bei der Erfassung komplexer langreichweitiger genomischer Zusammenhänge
- mögliche Generierung biologisch nicht funktionsfähiger Sequenzen
- uneinheitliche Benchmarking-Verfahren
- hoher Rechenaufwand
- Notwendigkeit experimenteller Validierung generierter Sequenzen
Eine statistisch plausible DNA-Sequenz ist nicht zwangsläufig biologisch funktionsfähig. Insbesondere bei der Generierung größerer genomischer Systeme bleibt die experimentelle Überprüfung daher essenziell.
Biosicherheit
Die Fähigkeit generativer Modelle, funktionelle biologische Sequenzen zu entwerfen, wirft Fragen der Biosicherheit und des Dual Use auf. Mit zunehmender Leistungsfähigkeit entsprechender Modelle werden daher unter anderem Sicherheitsmechanismen, Zugangskontrollen und Verfahren zur Bewertung generierter Sequenzen diskutiert.
Nach Einschätzung der ZKBS können gentechnisch veränderte Organismen mit KI-generierten Nukleinsäuresequenzen auch dann nach dem bestehenden deutschen Gentechnikrecht risikobewertet werden, wenn sich die Sequenzen keinem Spenderorganismus zuordnen lassen; dabei sind bekannte und vorhersehbare Eigenschaften der übertragenen Sequenzen zu berücksichtigen.[3]
Genom-Sprachmodelle sind somit nicht nur ein Werkzeug der Bioinformatik, sondern zunehmend auch Gegenstand der Biosecurity-Forschung.
Quellen
- ↑ Brixi et al., Genome modelling and design across all domains of life with Evo 2, Nature, 2026
- ↑ NCBI Taxonomy: Microviricetes, abgerufen am 25.09.2026
- ↑ ZKBS-Kommentar zu den Herausforderungen durch mittels künstlicher Intelligenz de novo generierte Nukleinsäuresequenzen und Proteine bei der Bewertung gentechnischer Arbeiten, Juni 2026, abgerufen am 25.09.2026
Literatur
- King SH, Driscoll CL, Li DB et al.: Generative design of bacteriophages with genome language models. Science. 2026
- Brixi G, Durrant MG, Ku J et al.: Genome modelling and design across all domains of life with Evo 2. Nature. 2026
- Veiner M, Supek F: The DNA dialect: a comprehensive guide to pretrained genomic language models. Molecular Systems Biology. 2026
- Mashhour MA, Abdel Wahed M, Mabrouk MS: Genomic language models (gLMs): Emerging applications, challenges, and future directions in computational genomics. Biochemical and Biophysical Research Communications. 2026