This thesis introduces ResearchShop Disease2Gene, a comprehensive system for automated extraction of gene-disease associations from full-text biomedical literature.
Unlike prior systems that typically rely on abstracts or limited text segments, Disease2Gene is distinguished by its full-text processing capabilities and integration of multiple literature retrieval techniques. The system employs intelligent literature retrieval, citation-based prioritisation, and multi-strategy full-text acquisition that prioritises PMC Open Access while also retrieving content from DOI links and publisher websites using Playwright browser automation and Trafilatura extraction.
A two-stage Large Language Model architecture uses Google’s Gemini models: a lightweight model for initial gene discovery and a more capable model for detailed schema-driven attribute extraction.
The central contribution is a comprehensive multi-layer validation framework designed to mitigate LLM hallucinations. The framework brings together a few practical checks: it verifies gene symbols against the HGNC database; it recognises HGVS-style variant descriptions; and it double-checks citations to ensure the quoted text is actually present in the original paper. Taken together, these steps help keep the extracted information accurate and easy to review.
Niniejsza praca przedstawia ResearchShop Disease2Gene — kompleksowy system automatycznej ekstrakcji powiązań między genami a chorobami z pełnotekstowej literatury biomedycznej.
W przeciwieństwie do wcześniejszych systemów, które zazwyczaj opierają się na streszczeniach lub ograniczonych fragmentach tekstu, Disease2Gene wyróżnia się możliwościami przetwarzania pełnotekstowego oraz integracją wielu technik wyszukiwania literatury. System wykorzystuje inteligentne wyszukiwanie literatury, priorytetyzację opartą na cytowaniach oraz wielostrategiczne pozyskiwanie pełnych tekstów, które priorytetyzuje PMC Open Access, jednocześnie pobierając treści z linków DOI oraz stron wydawców przy użyciu automatyzacji przeglądarki Playwright i ekstrakcji Trafilatura.
Dwuetapowa architektura dużych modeli językowych wykorzystuje modele Gemini firmy Google: lekki model do wstępnego wykrywania genów oraz bardziej zaawansowany model do szczegółowej ekstrakcji atrybutów opartej na schemacie.
Głównym wkładem jest kompleksowy wielowarstwowy system walidacji zaprojektowany w celu łagodzenia halucynacji LLM. System ten łączy kilka praktycznych mechanizmów kontroli: weryfikuje symbole genów względem bazy danych HGNC; rozpoznaje opisy wariantów w stylu HGVS; oraz podwójnie sprawdza cytowania, aby upewnić się, że cytowany tekst rzeczywiście występuje w oryginalnym artykule. Razem te kroki pomagają zachować dokładność wyekstrahowanych informacji i ułatwiają ich weryfikację.




