Zum Inhalt springen
scieneers
  • Story
  • Leistungen
    • Leistungen allgemein
    • KI für die Energiewirtschaft
    • Große Sprachmodelle für Ihre Daten
    • Erweiterbare AI-Chat-Basis
    • Azure über CSP beziehen
    • Microsoft Fabric Data Platforms
    • Social Impact @ scieneers
  • Workshops
    • Datenprodukt-Strategie Workshop
    • Microsoft Data Strategy & Analytics Assessment
    • Azure Data Platform Proof of Concept
    • Microsoft Fabric: „Bring Your Own Data“ Workshop
    • Power BI Training
  • Content
  • Team
  • Join
  • Kontakt
  • DE
  • EN
  • Menü Menü

Machine Learning Workflow zur Bewertung genetischer Varianten auf Basis von Proteinstrukturen

05.08.2025 – ca. 14 Min. Lesezeit – Zurück zur Startseite – Alle Blog-Artikel

Eine Zusammenarbeit des Zentrums für Humangenetik und Genommedizin, Universitätsklinikum RWTH Aachen & der scieneers GmbH

Warum sind manche genetische Varianten harmlos, während andere zu Krankheiten führen?

Diese Frage zählt zu den größten Herausforderungen der Genommedizin. Besonders bei seltenen Erkrankungen, von denen die Mehrheit Kinder betrifft, ist es oft schwierig, unter Millionen von Veränderungen in unserem Erbgut die tatsächlich krankheitsverursachende Variante zu identifizieren.

Viele dieser Fälle betreffen sogenannte Missense-Varianten – minimale Veränderungen in der DNA, die zu einem Austausch einer einzelnen Aminosäure im Protein führen. Welche Auswirkungen diese kleinen Veränderungen auf die Funktion des Proteins haben, ist häufig nur schwer einzuschätzen. Selbst moderne computergestützte Vorhersagetools liefern oft unklare Ergebnisse, wodurch viele Varianten als „von unbekannter klinischer Bedeutung“ eingestuft werden – mit weitreichenden Konsequenzen für betroffene Patienten und behandelnde Ärzte.

In unserer gemeinsamen Forschungsarbeit des Zentrums für Humangenetik und Genommedizin am Uniklinikum RWTH Aachen und der scieneers GmbH haben wir einen neuen Machine-Learning-Workflow entwickelt, der die dreidimensionale Proteinstruktur – bisher häufig vernachlässigt – in den Mittelpunkt rückt.

Hier gehts direkt zu unserem Paper: Utilizing protein structure graph embeddings to predict the pathogenicity of missense variants 

Warum Proteinstrukturen entscheidend sind

Die meisten bisherigen Vorhersagemodelle konzentrieren sich auf Merkmale wie evolutionäre Konservierung, Populationshäufigkeiten oder die Aminosäuresequenz des zugrunde liegenden Proteins – die „Sprache“ der Proteine. Doch letztlich entscheidet oft die 3D-Struktur eines Proteins darüber, ob und wie eine genetische Variante dessen Funktion beeinflusst – schließlich entstehen Eigenschaften und Aufgaben eines Proteins erst durch das Zusammenspiel seiner Aminosäuren im Raum.

Vorhersagemodelle nutzen diese strukturellen Daten jedoch bisher kaum, oder sie greifen primär auf die Struktur des Wildtyps (unveränderte Proteine) bzw. auf stark vereinfachte Kennzahlen zurück.

Unser Ansatz: Anreicherung etablierter Modelle mit Proteinstruktur-Embeddings

Genommedizin trifft auf Machine Learning:

  • Mithilfe von ESMFold, einem modernen Modell zur Proteinstrukturprädiktion, haben wir die 3D-Strukturen von > 60.000 veränderten und unveränderten Proteinen vorhergesagt.
  • Diese Strukturen wurden mithilfe von Graph-Autoencoder-Netzwerken in sogenannte Graph-Embeddings transformiert. So entsteht eine komprimierte, aber informationsreiche Repräsentation komplexer Proteinstrukturen.
  • Diese Embeddings dienten wiederum als Input für unsere Klassifikationsmodelle, die vorhersagen können, ob eine Variante wahrscheinlich krankheitsverursachend ist.

Ein klarer Mehrwert: Verbesserung etablierter Vorhersagewerte

Wie groß ist nun der praktische Nutzen dieser Strukturinformation?

Wir haben unser Verfahren getestet, indem wir den bekannten CADD-Score – ein etabliertes Maß für die Pathogenität genetischer Varianten – um unsere Graph-Embeddings ergänzt haben. Das Ergebnis: Die Vorhersagen wurden durch die zusätzlichen Strukturinformationen spürbar präziser.

Bemerkenswert ist: Obwohl der CADD-Score bereits sequenzbasierte Informationen (Aminosäurensequenz) aus ESM-Modellen berücksichtigt, brachte die direkte Einbindung der 3D-Struktur einen echten Zusatznutzen. Dies unterstreicht, dass zukünftige Vorhersagetools idealerweise sowohl Sequenz- als auch Strukturdaten kombinieren sollten.

Neue Wege und Perspektiven

Die zugrundeliegenden Methoden sind skalierbar – Datenbanken wie AlphaFold oder ESMFold wachsen rasant und umfassen bereits einen Großteil des menschlichen Proteoms. Unser Ansatz kann daher grundsätzlich auf alle kodierenden Varianten im Genom angewendet werden.

Übrigens: Die generierten Protein-Embeddings sind nicht nur für die Interpretation genetischer Varianten nützlich, sondern könnten auch für andere Aufgaben wie die Vorhersage von Protein-Funktionen eingesetzt werden.

Schon gewusst?

Für die Entwicklung von AlphaFold, einem weiteren wegweisenden Modell zur Vorhersage von Proteinstrukturen, wurde 2024 der Nobelpreis für Chemie verliehen. Solch komplexe KI-Modelle erfordern enorme Rechenkapazitäten – moderne Cloud-Plattformen machen es möglich, diese Modelle effizient und skalierbar zu betreiben. Wir haben hierfür die Azure Cloud in Kombination mit Databricks genutzt, um die Strukturen von über 60.000 Proteinen vorherzusagen und unsere eigenen Machine-Learning-Modelle zu trainieren.

Nobelpreisträger David Baker, Demis Hassabis und John M. Jumper. Illustrationen: Niklas Elmehed © Nobel Prize Outreach, CC BY-NC-SA

Fazit

  • Proteinstruktur ist entscheidend: Die explizite Nutzung von 3D-Strukturen verbessert die Interpretation genetischer Varianten deutlich.
  • Maschinelles Lernen trifft auf Genommedizin: Graph-Embeddings erlauben es Modellen, jenseits der Sequenz neue Zusammenhänge zu „erkennen“.
  • Gemeinsam zum Ziel: Diese Arbeit verdeutlicht die Stärke interdisziplinärer Zusammenarbeit zwischen Data Scientisten, Engineers und Domänenexperten.

Durch unseren Beitrag und die kooperative Forschung wollen wir einen kleinen, aber wichtigen Teil zur Beantwortung aktueller Fragen der Genommedizin leisten. Unser Ziel ist es, künftig die Diagnose und Therapie – insbesondere für Menschen mit seltenen Erkrankungen – weiter zu verbessern.

Autoren

Martin Danner

Martin Danner, Data Scientist bei scieneers GmbH
martin.danner@scieneers.de

Dr. Jeremias Krause, Assistenzarzt, UKA
jerkrause@ukaachen.de

Weitere Blog-Beiträge

Straßenbahndepot bei Nacht mit mehreren abgestellten Straßenbahnen und einer fahrenden Straßenbahn, überlagert von digitalen Grafiken zur dynamischen Disposition und Gleisbelegung.

Dynamische Disposition in Straßenbahndepots durch Reinforcement Learning

26. Mai 2026
Wenn der Linienbetrieb endet, beginnt im Straßenbahndepot ein komplexes Optimierungsproblem. Gemeinsam mit der Firma IVU Traffic Technologies haben wir untersucht, wie Deep Reinforcement Learning die dynamische Disposition im Depot unterstützen kann.
https://www.scieneers.de/wp-content/uploads/2026/05/Screenshot-2026-05-22-090434.jpeg 692 1272 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-05-26 08:27:482026-05-26 08:35:31Dynamische Disposition in Straßenbahndepots durch Reinforcement Learning

Rückblick auf unser Frühlingsevent 2026

18. Mai 2026
Beim diesjährigen Frühlingsevent in Köln kamen Kolleg:innen aus allen Standorten zusammen, darunter erstmals auch welche aus Berlin und München. Zwei Tage lang standen Austausch, Teamkultur und spannende interne Themen im Mittelpunkt – von Leistungsbeurteilung und Feedback über KI-Ethik bis hin zu Diversity, Co-Design und gemeinsamen Aktivitäten in Köln. Der Rückblick zeigt, wie wertvoll persönliche Begegnungen sind, wenn ein Team weiter wächst und zugleich eng verbunden bleiben möchte.
https://www.scieneers.de/wp-content/uploads/2026/05/IMG_8452-scaled.jpg 1372 2560 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-05-18 11:57:432026-05-18 22:56:25Rückblick auf unser Frühlingsevent 2026
Mehrere überlappende Präsentationsfolien mit Titeln zu KI-Bildgenerierung und Datenpipelines sowie zwei Personen, die jeweils vor einem Mikrofon sprechen

Frühlingskonferenzen 2026: PyCon DE und PyData & Minds Mastering Machines

13. Mai 2026
Bei den Frühlingskonferenzen 2026 drehte sich alles um KI, Daten und praxisnahe Engineering-Themen. Auf der PyCon DE & PyData sowie der Minds Mastering Machines hielten wir Vorträge zu RAG-Pipelines mit multimodalen Embeddings, Spec-Driven Development, Genolator und KI-Bildgenerierung. Dieser Beitrag gibt einen kompakten Überblick über die wichtigsten Inhalte, technischen Erkenntnisse und zentralen Erkenntnisse der Konferenzen.
https://www.scieneers.de/wp-content/uploads/2026/05/Blog-Post-Bild.png 1080 1920 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2026-05-13 16:30:072026-05-13 16:30:12Frühlingskonferenzen 2026: PyCon DE und PyData & Minds Mastering Machines

IT-Tage 2025

19. Dezember 2025
Data Science, KI und Cloud-Architekturen sind unser tägliches Geschäft – doch manchmal lohnt es sich, die eigene Blase zu verlassen. Genau das taten unsere scieneers-Kolleg:innen Mitte Dezember auf den IT-Tagen 2025 in Frankfurt. Zwischen den Themen Softwarearchitektur, DevOps, agilen Methoden und digitaler Souveränität haben wir Impulse mitgenommen, die direkt in unsere tägliche Arbeit rund um skalierbare RAG-Systeme, saubere Softwarearchitektur und Monitoring einfließen werden.
https://www.scieneers.de/wp-content/uploads/2025/12/IT-Tage-2025.jpg 150 300 Alina Dallmann https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png Alina Dallmann2025-12-19 13:45:202026-01-14 08:23:03IT-Tage 2025
Diagramm zeigt Datenfluss von Datenquellen über KI-Embedding zu PostgreSQL mit pgvector, dann zu Vektor- und Volltextsuche mit Zeilenebenen-Sicherheit und Abruf.

Implementierung von RAG mit PostgreSQL

15. Dezember 2025
Vom Einstieg in Retrieval-Augmented Generation (RAG) mit PostgreSQL bis zur Implementierung hybrider Suchlösungen: Der Beitrag erklärt, wie die Erweiterung pgvector Vektorsuche ermöglicht, Volltextsuche ergänzt und durch Row-Level Security (RLS) Datenzugriff schützt. Mit praktischen Anleitungen und Performance-Optimierungen zeigt er, wie ein effizientes, sicheres RAG-System ohne zusätzliche Infrastruktur aufgebaut werden kann.
https://www.scieneers.de/wp-content/uploads/2025/12/blog_image-1-scaled.png 1445 2560 Arne Grobruegge https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png Arne Grobruegge2025-12-15 09:44:152026-01-14 08:22:50Implementierung von RAG mit PostgreSQL

PyData 2025

5. September 2025
Drei Tage voller Talks, Tutorials und Tech-Community-Spirit – das war die PyData Berlin 2025 im bcc Berlin Congress Center. Im Fokus standen Open-Source-Tools, Agentic AI und die Frage: Wie lassen sich LLMs produktiv und kontrolliert einsetzen? Wir von scieneers waren mit einem Vortrag zu LiteLLM vertreten – „One API to Rule Them All? LiteLLM in Production“.
https://www.scieneers.de/wp-content/uploads/2025/09/PyData-Berlin-Bild.png 1260 2240 shinchit.han@scieneers.de https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png shinchit.han@scieneers.de2025-09-05 17:43:282026-01-14 08:21:31PyData 2025

M3 2025

21. Mai 2025
Auf der diesjährigen Minds Mastering Machines (M3) Konferenz in Karlsruhe standen neben Best Practices zu GenAI, RAG-Systemen auch Praxisberichte aus verschiedenen Branchen, Agentensysteme und LLM sowie rechtliche Aspekte von ML im Fokus. Wir haben drei Vorträge zu unseren Projekten gehalten.
https://www.scieneers.de/wp-content/uploads/2025/05/m3-header.jpg-95618f16427fc555-1.webp 567 1008 Nico Kreiling https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png Nico Kreiling2025-05-21 14:37:012025-08-22 13:07:07M3 2025

DesinfoNavigator

21. Februar 2025
DesinfoNavigator ist ein Online-Tool, das Nutzer beim Erkennen von Desinformation unterstützt, indem es Texte auf irreführende rhetorische Strategien untersucht. Es basiert auf dem PLURV-Framework und verwendet ein großes Sprachmodell, um Indizien für Desinformation zu identifizieren und Handlungsanweisungen zur Überprüfung zu generieren. Es ergänzt Faktenchecks, ist kostenlos und fördert kritisches Denken im Umgang mit Informationen.
https://www.scieneers.de/wp-content/uploads/2025/02/Output-desinfonavigator_0.png 914 1672 Nico Kreiling https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png Nico Kreiling2025-02-21 11:03:012025-08-22 13:08:30DesinfoNavigator

KI trifft Datenschutz: Unsere ChatGPT-Lösung für Unternehmenswissen

18. Dezember 2024
Unsere ChatGPT-Lösung ermöglicht es Unternehmen, firmeninternes Wissen sicher und datenschutzkonform zu nutzen. Mittels eines modularen Systems, das auf unternehmensspezifische Datenquellen wie SharePoint und OneDrive zugreift, können Mitarbeiter schnell und einfach auf Informationen zugreifen. Die Lösung bietet personalisierte Budgetverwaltung, sichere Authentifizierung und eine anpassbare Benutzeroberfläche, inklusive Feedback-Mechanismen für kontinuierliche Verbesserungen.
https://www.scieneers.de/wp-content/uploads/2024/12/bild.jpg 899 1599 Alina Dallmann https://www.scieneers.de/wp-content/uploads/2020/04/scieneers-gradient.png Alina Dallmann2024-12-18 15:51:332025-08-22 13:09:04KI trifft Datenschutz: Unsere ChatGPT-Lösung für Unternehmenswissen
Zurück Zurück Zurück Weiter Weiter Weiter

© Copyright scieneers – Impressum | Datenschutz
Nach oben scrollen Nach oben scrollen Nach oben scrollen