Zum Inhalt springen
scieneers
  • Story
  • Leistungen
    • Leistungen allgemein
    • KI für die Energiewirtschaft
    • Große Sprachmodelle für Ihre Daten
    • Erweiterbare AI-Chat-Basis
    • Azure über CSP beziehen
    • Microsoft Fabric Data Platforms
    • Social Impact @ scieneers
  • Workshops
    • Datenprodukt-Strategie Workshop
    • Microsoft Data Strategy & Analytics Assessment
    • Azure Data Platform Proof of Concept
    • Microsoft Fabric: „Bring Your Own Data“ Workshop
    • Power BI Training
  • Content
  • Team
  • Join
  • Kontakt
  • DE
  • EN
  • Menü Menü

Die Suche nach der Nadel im genomischen Heuhaufen

Genommedizin trifft auf Machine Learning

04.06.2026 – ca. 7 Min. Lesezeit – Zurück zur Startseite – Alle Blog-Artikel

Jedes Genom enthält ungefähr 3,5 Millionen genetische Varianten.
Die meisten davon haben keinerlei Wirkung.
Doch manchmal kann schon eine einzige Veränderung eines DNA‑Buchstabens eine lebensbedrohliche Krankheit verursachen.

Diese eine Variante unter Millionen zu finden, gehört zu den zentralen Herausforderungen der Genommedizin.

Als ich angefangen habe am Zentrum für Humangenetik und Genommedizin in Aachen zu arbeiten, hat mich eine Zahl besonders überrascht:

350 Millionen.

So viele Menschen leben weltweit mit einer seltenen Erkrankung.

In der EU gilt eine Krankheit als selten, wenn weniger als 1 von 2.000 Menschen betroffen ist. Für sich genommen klingt das ungewöhnlich — doch in Summe betreffen seltene Erkrankungen Millionen von Menschen.
(Quelle: European Commission)

Allein in Deutschland leben rund 4 Millionen Menschen mit einer seltenen Erkrankung.

🧬 Viele seltene Erkrankungen gehen auf eine einzige genetische Veränderung zurück

Was viele nicht wissen: Die meisten seltenen Erkrankungen werden durch eine einzelne genetische Variante verursacht.

Eine der häufigsten Formen ist die sogenannte Single Nucleotide Variant (SNV) — eine Veränderung von nur einem einzigen Buchstaben in unserer DNA.

Unsere DNA besteht aus vier Nukleotiden:

  • A – Adenin
  • T – Thymin
  • G – Guanin
  • C – Cytosin

Während der Proteinbiosynthese wird diese DNA‑Sequenz zunächst in Messenger‑RNA (mRNA) transkribiert und anschließend in Proteine übersetzt, die fast alle Funktionen in unseren Zellen ausführen.

Missense‑Varianten erklärt anhand der Proteinbiosynthese: Rechts ist eine Single Nucleotide Variant dargestellt, die zu einer Missense‑Variante führt. Weitere Variantentypen sind Nonsense‑, Synonyme- und Loss‑of‑Function‑Varianten.

Missense‑Varianten erklärt anhand der Proteinbiosynthese: Rechts ist eine Single Nucleotide Variant dargestellt, die zu einer Missense‑Variante führt. Weitere Variantentypen sind Nonsense‑, Synonyme- und Loss‑of‑Function‑Varianten.

Wenn sich ein einzelnes Nukleotid verändert, kann sich auch das daraus resultierende Protein verändern.

Diese Varianten können unterschiedliche Konsequenzen haben, zum Beispiel:

  • Missense‑Varianten verändern eine Aminosäure im Protein
  • Nonsense‑Varianten führen zu einem vorzeitigen Stoppsignal
  • Synonyme Varianten lassen die Aminosäure unverändert

Die Schwierigkeit besteht darin, dass nicht jede Veränderung schädlich ist.

Tatsächlich trägt der durchschnittliche Mensch mehr als 9.000 Missense‑Varianten und die überwiegende Mehrheit davon ist völlig harmlos.
(Quelle: Exome sequencing and analysis of 454,787 UK Biobank participants)

Wenn Kliniker also das Genom eines Patienten analysieren, suchen sie im Grunde nach einer einzigen krankheitsverursachenden Variante unter Millionen.

Ein klassisches Nadel im Heuhaufen Problem.

🧠 Hier kommt Machine Learning ins Spiel

Die Herausforderung wird noch größer, wenn man bedenkt, wie viel vom Genom wir noch immer nicht vollständig verstehen.

Nur etwa 2 % des Genoms kodieren direkt für Proteine, zumindest nach dem aktuellen Stand der Wissenschaft. Die übrigen 98 % — manchmal als „Dark Genome“ bezeichnet — sind deutlich schwerer zu interpretieren, obwohl Varianten auch dort Krankheiten verursachen können.
(Quelle: Shedding light on the dark genome)

Um dieses Problem anzugehen, greifen Forschende zunehmend auf Machine Learning Modelle zurück, die abschätzen, ob eine Variante wahrscheinlich pathogen ist. Diese Modellierung wird als Variant Effect Prediction bezeichnet.

Werkzeuge wie AlphaMissense, CADD, SIFT, REVEL oder SpliceAI helfen dabei, Varianten zu priorisieren und die Suche einzugrenzen.

Ein besonders interessantes Modell darunter ist AlphaMissense, entwickelt von DeepMind.

AlphaMissense baut auf der Idee von AlphaFold auf — ein Modell zur Vorhersage von 3D-Proteinstrukturen, das Demis Hassabis und John Jumper im Jahr 2024 den Nobelpreis für Chemie eingebracht hat. Während AlphaFold die dreidimensionale Struktur von Proteinen aus ihrer Aminosäuresequenz vorhersagt, wurde AlphaMissense entwickelt, um die Auswirkungen von Missense‑Varianten zu bewerten.

Wie wir zuvor gesehen haben, verändern Missense‑Varianten eine einzelne Aminosäure in einem Protein. Ob diese Veränderung schädlich ist, hängt unter anderem stark davon ab, wie sie die Struktur und Funktion des Proteins beeinflusst.

Genau das versucht AlphaMissense abzuschätzen.

Das Modell vergibt einen Score zwischen 0 und 1, der widerspiegelt, wie wahrscheinlich es ist, dass eine Missense‑Variante pathogen statt harmlos ist. Diese Vorhersagen helfen Klinikern und Forschenden dabei, Varianten bei der Analyse von Patientengenomen zu priorisieren und bringen uns einen Schritt näher daran, die Nadel im genomischen Heuhaufen zu finden.

Als DeepMind AlphaMissense veröffentlichte, stellten sie außerdem Vorhersagen für 71 Millionen mögliche Missense‑Varianten im kodierenden Bereich unseres Genoms bereit.
(Quelle: A catalogue of genetic mutations to help pinpoint the cause of diseases)

Auch wenn die Modellgewichte selbst nicht veröffentlicht wurden (das Modell also nicht vollständig Open Source ist), stellte DeepMind eine Referenzimplementierung von AlphaMissense auf GitHub bereit, damit Forschende die Methodik nachvollziehen können:

👉 https://github.com/google-deepmind/alphamissense

Natürlich haben Modelle wie AlphaMissense auch ihre Grenzen.

Sie wurden speziell für Missense‑Varianten in protein‑kodierenden Regionen entwickelt. Das bedeutet, dass sie beispielsweise folgende Varianten nicht direkt bewerten können:

  • Varianten in nicht‑kodierenden Regionen
  • Insertionen und Deletionen (Indels)
  • größere strukturelle Varianten
  • Varianten, die Genregulation oder Splicing beeinflussen

Jeder dieser Variantentypen erfordert andere Modellierungsansätze.

 🩸 Ein reales Beispiel: Sichelzellanämie

Doch wie sieht eine Krankheit aus, die tatsächlich durch eine einzelne Nukleotidveränderung verursacht wird?

Eines der faszinierendsten Beispiele ist die Sichelzellanämie — eine Mutation, die eine schwere genetische Erkrankung verursacht, gleichzeitig aber einen gewissen Schutz vor Malaria bietet.

Interessanterweise war genau diese Krankheit Thema in Gesprächen während eines Workshops, an dem ich vor zwei Jahren am CSIR‑IGIB in Neu‑Delhi teilgenommen habe.

Mehr dazu im nächsten Beitrag 🙂

Unser Beitrag

In meiner gemeinsamen Forschung mit dem Zentrum für Humangenetik und Genommedizin am Uniklinikum RWTH Aachen entwickeln und wenden wir Machine Learning Modelle an, um neue Erkenntnisse aus genomischen Daten zu gewinnen und so einen Beitrag für die so wichtige genommedizinsche Forschung und eine bessere Gesundheitsversorgung zu leisten. Darüber hinaus tragen wir durch den Aufbau und die Weiterentwicklung der Cloud‑Infrastruktur und der Data‑Lakehouse‑Architektur dazu bei, eine skalierbare Analyse genomischer Daten zu ermöglichen.

Wenn ihr Interesse an dieser Arbeit oder an möglichen Kooperationen haben oder Unterstützung braucht, kommt gerne auf uns zu.

Autor

Martin Danner

Martin Danner, Data Scientist & ML Engineer at scieneers GmbH


martin.danner@scieneers.de


LinkedIn


ORCID iD

Weitere Blog-Posts

Die Suche nach der Nadel im genomischen Heuhaufen

4. Juni 2026
Jedes menschliche Genom enthält Millionen genetischer Varianten. Die meisten sind harmlos, doch manchmal kann schon eine einzige Veränderung eine schwere Krankheit verursachen. Diese eine Variante zu finden gleicht der Suche nach der Nadel im Heuhaufen – eine Herausforderung, die zunehmend mit Machine Learning angegangen wird.
https://www.scieneers.de/wp-content/uploads/2026/06/blog_post_genomic_haystack.png 1024 1536 Martin Danner https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png Martin Danner2026-06-04 15:26:032026-07-08 17:19:08Die Suche nach der Nadel im genomischen Heuhaufen
Straßenbahndepot bei Nacht mit mehreren abgestellten Straßenbahnen und einer fahrenden Straßenbahn, überlagert von digitalen Grafiken zur dynamischen Disposition und Gleisbelegung.

Dynamische Disposition in Straßenbahndepots durch Reinforcement Learning

26. Mai 2026
Wenn der Linienbetrieb endet, beginnt im Straßenbahndepot ein komplexes Optimierungsproblem. Gemeinsam mit der Firma IVU Traffic Technologies haben wir untersucht, wie Deep Reinforcement Learning die dynamische Disposition im Depot unterstützen kann.
https://www.scieneers.de/wp-content/uploads/2026/05/Screenshot-2026-05-22-090434.jpeg 692 1272 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-05-26 08:27:482026-05-26 08:35:31Dynamische Disposition in Straßenbahndepots durch Reinforcement Learning

Rückblick auf unser Frühlingsevent 2026

18. Mai 2026
Beim diesjährigen Frühlingsevent in Köln kamen Kolleg:innen aus allen Standorten zusammen, darunter erstmals auch welche aus Berlin und München. Zwei Tage lang standen Austausch, Teamkultur und spannende interne Themen im Mittelpunkt – von Leistungsbeurteilung und Feedback über KI-Ethik bis hin zu Diversity, Co-Design und gemeinsamen Aktivitäten in Köln. Der Rückblick zeigt, wie wertvoll persönliche Begegnungen sind, wenn ein Team weiter wächst und zugleich eng verbunden bleiben möchte.
https://www.scieneers.de/wp-content/uploads/2026/05/IMG_8452-scaled.jpg 1372 2560 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-05-18 11:57:432026-05-18 22:56:25Rückblick auf unser Frühlingsevent 2026
Mehrere überlappende Präsentationsfolien mit Titeln zu KI-Bildgenerierung und Datenpipelines sowie zwei Personen, die jeweils vor einem Mikrofon sprechen

Frühlingskonferenzen 2026: PyCon DE und PyData & Minds Mastering Machines

13. Mai 2026
Bei den Frühlingskonferenzen 2026 drehte sich alles um KI, Daten und praxisnahe Engineering-Themen. Auf der PyCon DE & PyData sowie der Minds Mastering Machines hielten wir Vorträge zu RAG-Pipelines mit multimodalen Embeddings, Spec-Driven Development, Genolator und KI-Bildgenerierung. Dieser Beitrag gibt einen kompakten Überblick über die wichtigsten Inhalte, technischen Erkenntnisse und zentralen Erkenntnisse der Konferenzen.
https://www.scieneers.de/wp-content/uploads/2026/05/Blog-Post-Bild.png 1080 1920 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-05-13 16:30:072026-05-13 16:30:12Frühlingskonferenzen 2026: PyCon DE und PyData & Minds Mastering Machines

Gestaltungsmöglichkeiten für Mitarbeitende bei scieneers 

22. April 2026
Bei scieneers wird Mitarbeitendenbeteiligung als Ausdruck von Wertschätzung und gemeinsamer Verantwortung gelebt. So profitieren die Teams nicht nur vom Unternehmenserfolg, sondern gestalten ihn auch aktiv mit. In einer offenen Kultur werden Transparenz, Vertrauen und Teamgeist gefördert.
https://www.scieneers.de/wp-content/uploads/2026/04/MB-BP-Bild-Cropped.png 1080 1920 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-04-22 09:30:362026-05-06 14:36:03Gestaltungsmöglichkeiten für Mitarbeitende bei scieneers 
Isometrische Darstellung von vernetzten Computern und Geräten mit Datenflusssymbolen

Bewerbungsprozess bei scieneers

13. März 2026
Du möchtest Teil von scieneers werden? Hier erfährst du Schritt für Schritt, wie unser Bewerbungsprozess aussieht – von der Online-Bewerbung über Remote-Interviews bis zum Kennenlernen vor Ort. Finde heraus, ob wir zueinander passen, und entdecke, was im Bewerbungsprozess besonders wichtig ist: Persönlichkeit, Eigeninitiative und Begeisterung für Technik.
https://www.scieneers.de/wp-content/uploads/2026/03/Untitled-design.png 1260 2240 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-03-13 09:47:352026-06-05 10:24:49Bewerbungsprozess bei scieneers

Einblicke von der Microsoft AI Tour 2026 in München – zwischen Vision, Souveränität und konkreten Anwendungen

12. März 2026
Ein Besuch auf der Microsoft AI Tour 2026 in München zeigt, wie rasant sich KI von einer experimentellen Technologie zu einer zentralen Infrastruktur für Unternehmen und Forschung entwickelt. Von multimodalen Modellen im Healthcare‑Bereich über neue Konzepte digitaler Souveränität bis hin zu KI‑gestützten Entwicklungsplattformen und Agenten in Business‑Prozessen – ein persönlicher Erfahrungsbericht über die wichtigsten Eindrücke und Entwicklungen rund um die nächste Generation von KI‑Systemen.
https://www.scieneers.de/wp-content/uploads/2026/03/ms-ai-tour-launch-city.jpg 960 1472 Martin Danner https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png Martin Danner2026-03-12 22:22:492026-03-13 15:46:22Einblicke von der Microsoft AI Tour 2026 in München – zwischen Vision, Souveränität und konkreten Anwendungen
Vier vertikale, abgerundete Balken mit Symbolen und Texten zu PoC, Prototyp, MVP und Pilot vor hexagonalem Hintergrund

PoC vs Prototyp vs MVP vs Pilot

6. Februar 2026
Bei der Planung von Datenprodukten oder Softwareprojekten entsteht oft erst durch eine klare Abgrenzung der Entwicklungsphasen Klarheit. Ein stufenweiser Aufbau reduziert die Unsicherheit schrittweise und gleicht die Erwartungen in interdisziplinären Teams an.
https://www.scieneers.de/wp-content/uploads/2026/02/PoC-vs-Prototyp-vs-MVP-vs-Pilot.png 1375 2385 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-02-06 13:50:342026-02-27 16:20:32PoC vs Prototyp vs MVP vs Pilot

KI-Bildgenerierung in der Praxis

5. Februar 2026
Die KI-Bildgenerierung hat 2025 einen massiven Sprung gemacht: Von verzerrten Ergebnissen hin zu fotorealistischen 4K-Bildern in Echtzeit. In diesem Beitrag beleuchten wir die Funktionsweise moderner Diffusionsmodelle, geben praktische Tipps für strukturiertes Prompting und zeigen anhand eines Kundenprojekts zur Storyboard-Erstellung, wie man Konsistenz über mehrere Bilder hinweg erzielt. Außerdem erklären wir, was die derzeit besten Modelle sind und wo die Grenzen der Technologie liegen.
https://www.scieneers.de/wp-content/uploads/2026/02/generation-0b7e1601-bb5a-46a3-8ec2-c8fbc34c2c85.png 752 1328 mats.faulborn@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png mats.faulborn@scieneers.de2026-02-05 15:08:342026-03-31 09:12:20KI-Bildgenerierung in der Praxis
Zurück Zurück Zurück Weiter Weiter Weiter
© Copyright scieneers – Impressum | Datenschutz
Nach oben scrollen Nach oben scrollen Nach oben scrollen