
Genmutatie AI / NLP Deep Learning
Inzet van NLP voor verbeterde analyse van genetische mutaties en ziektecorrelaties.
problem
Onze klant is een healthcare-startup die zich richt op de ontwikkeling van software voor gepersonaliseerde diagnostiek en behandeling, met als doel geavanceerde technologieën in te zetten om medische processen te verbeteren. Ondanks de enorme hoeveelheid informatie op internet, hebben conventionele zoekmachines moeite met complexe zoekopdrachten, vooral in het medische domein. Met name het navigeren door de PubMed-bibliotheek vormt een uitdaging vanwege het enorme volume aan data. De klant identificeerde de behoefte aan een systeem dat in staat is om wetenschappelijke abstracts van PubMed te analyseren, specifiek gericht op het vaststellen van verbanden tussen ziekten en genetische mutaties om te helpen bij de diagnostiek.
problem
Onze klant is een healthcare-startup die zich richt op de ontwikkeling van software voor gepersonaliseerde diagnostiek en behandeling, met als doel geavanceerde technologieën in te zetten om medische processen te verbeteren. Ondanks de enorme hoeveelheid informatie op internet, hebben conventionele zoekmachines moeite met complexe zoekopdrachten, vooral in het medische domein. Met name het navigeren door de PubMed-bibliotheek vormt een uitdaging vanwege het enorme volume aan data. De klant identificeerde de behoefte aan een systeem dat in staat is om wetenschappelijke abstracts van PubMed te analyseren, specifiek gericht op het vaststellen van verbanden tussen ziekten en genetische mutaties om te helpen bij de diagnostiek.
solution
Om deze uitdaging aan te pakken, heeft ons team een op NLP gebaseerde oplossing ontworpen die wetenschappelijke abstracts van PubMed kan parsen en inhoudelijke analyses kan uitvoeren om de impact van genetische mutaties op ziekten te identificeren. Via API-verzoeken kunnen gebruikers ziekte- en mutatiegegevens invoeren, samen met MESH- en OMIM-codes, om lijsten te verkrijgen die de relatie tussen mutaties en ziekten detailleren. Dit systeem biedt onschatbare inzichten voor medische professionals tijdens patiëntenonderzoeken en diagnoseprocessen. De technische scope van het project werd voornamelijk gedekt door Python, waarbij het BioBERT-model werd gebruikt voor het identificeren van ziekte-mutatieverbindingen en het SpaCy-model voor etniciteitsherkenning. Alle abstracts werden opgeslagen in een ElasticSearch-database en de oplossing werd geïmplementeerd op Amazon Web Services (AWS) voor schaalbaarheid en betrouwbaarheid.
solution
Om deze uitdaging aan te pakken, heeft ons team een op NLP gebaseerde oplossing ontworpen die wetenschappelijke abstracts van PubMed kan parsen en inhoudelijke analyses kan uitvoeren om de impact van genetische mutaties op ziekten te identificeren. Via API-verzoeken kunnen gebruikers ziekte- en mutatiegegevens invoeren, samen met MESH- en OMIM-codes, om lijsten te verkrijgen die de relatie tussen mutaties en ziekten detailleren. Dit systeem biedt onschatbare inzichten voor medische professionals tijdens patiëntenonderzoeken en diagnoseprocessen. De technische scope van het project werd voornamelijk gedekt door Python, waarbij het BioBERT-model werd gebruikt voor het identificeren van ziekte-mutatieverbindingen en het SpaCy-model voor etniciteitsherkenning. Alle abstracts werden opgeslagen in een ElasticSearch-database en de oplossing werd geïmplementeerd op Amazon Web Services (AWS) voor schaalbaarheid en betrouwbaarheid.
results
In eerste instantie hebben we een NLP-model voor abstractverwerking ontwikkeld op basis van het BioBERT-model, dat vooraf is getraind in biomedische taal. Het trainen van ons model omvatte het gebruik van een gestructureerde dataset bestaande uit 6000 trainings- en 2000 testverbindingen van mutaties en ziekten, geëxtraheerd uit bijna 600 abstracts. Elk artikel in de dataset kon meerdere ziekte-mutatieverbindingen bevatten. Om een volledig begrip te garanderen, hebben we bovendien het SpaCy-model geïntegreerd om 'named entities' te identificeren en te extraheren, met een specifieke focus op demografische informatie zoals etniciteit. Na de ontwikkelingsfase hebben we een infrastructuur opgezet voor de opslag en verwerking van wetenschappelijke artikelen en onze oplossing naadloos geïntegreerd in het systeem van de klant via een API-koppeling. De tool downloadt en verwerkt automatisch medische abstracts en werkt de database continu bij met nieuwe publicaties, die allemaal worden opgeslagen in een ElasticSearch-database.
results
In eerste instantie hebben we een NLP-model voor abstractverwerking ontwikkeld op basis van het BioBERT-model, dat vooraf is getraind in biomedische taal. Het trainen van ons model omvatte het gebruik van een gestructureerde dataset bestaande uit 6000 trainings- en 2000 testverbindingen van mutaties en ziekten, geëxtraheerd uit bijna 600 abstracts. Elk artikel in de dataset kon meerdere ziekte-mutatieverbindingen bevatten. Om een volledig begrip te garanderen, hebben we bovendien het SpaCy-model geïntegreerd om 'named entities' te identificeren en te extraheren, met een specifieke focus op demografische informatie zoals etniciteit. Na de ontwikkelingsfase hebben we een infrastructuur opgezet voor de opslag en verwerking van wetenschappelijke artikelen en onze oplossing naadloos geïntegreerd in het systeem van de klant via een API-koppeling. De tool downloadt en verwerkt automatisch medische abstracts en werkt de database continu bij met nieuwe publicaties, die allemaal worden opgeslagen in een ElasticSearch-database.
