Współczesne modele automatycznego rozpoznawania mowy (speech-to-text) mają trudności z dokładną transkrypcją nazw polskich produktów farmaceutycznych, co stanowi barierę w rozwoju systemów zautomatyzowanej dokumentacji medycznej. Rozwiązanie tego problemu jest kluczowe, ponieważ odciążenie lekarzy z administracyjnych obowiązków związanych z ręcznym sporządzaniem notatek pozwala im na szybsze i dokładniejsze przeprowadzanie badań oraz pełne skupienie się na pacjencie.
W niniejszym badaniu wykorzystano model OpenAI Whisper, który został przeszkolony na w pełni syntetycznym zbiorze danych, stworzonym od podstaw bez dostępu do specjalistycznych baz medycznych czy farmaceutycznych. Podkreśla to elastyczność w projektowaniu tego typu systemów, wykazując w szczególności wysoką opłacalność oraz szybszy cykl wdrożeniowy.
Model przetestowany na danych syntetycznych oraz nagranych przez ludzi z powodzeniem rozpoznaje 7543 komercyjne nazwy leków, podczas gdy 455 nazw nie jest wykrywanych, a 382 są wykrywane częściowo. W testach przeprowadzonych wyłącznie w warunkach rzeczywistych na reprezentatywnej próbie 30 zróżnicowanych fonetycznie nazw przy użyciu dynamicznych danych niesyntetycznych system osiągnął średni wynik miary F1 na poziomie 87,4%.
Opracowany model automatycznego rozpoznawania mowy (ASR) stanowi fundament kompleksowego rozwiązania opartego na Agentic AI, stworzonego z myślą o polskich placówkach medycznych. W praktycznym kontekście klinicznym umożliwia on automatyczne wprowadzanie dokumentacji medycznej bezpośrednio do systemów Elektronicznej Dokumentacji Medycznej (EDM), co znacząco optymalizuje procesy kliniczne i efektywność operacyjną.
Modern speech-to-text (automatic speech recognition) models struggle with the accurate transcription of Polish pharmaceutical product names, which poses a barrier to the development of automated medical documentation systems. Addressing this issue is crucial, as relieving physicians of the administrative burdens associated with manual note-taking allows them to conduct examinations faster and more accurately, while focusing entirely on the patient.
In this study, the OpenAI Whisper model was utilized, which was trained on a fully synthetic dataset created from scratch without access to specialized medical or pharmaceutical databases. This highlights the flexibility in designing such systems, demonstrating in particular high cost-effectiveness and a faster deployment cycle.
The model, tested on both synthetic and human-recorded data, successfully recognizes 7,543 commercial drug names, while 455 names go undetected, and 382 are partially detected. In tests conducted exclusively under real-world conditions on a representative sample of 30 phonetically diverse names using dynamic non-synthetic data, the system achieved an average F1-score of 87.4%.
The developed automatic speech recognition (ASR) model serves as the foundation for a comprehensive Agentic AI-based solution, created specifically for Polish medical facilities. In a practical clinical context, it enables the automatic entry of medical documentation directly into Electronic Health Record (EHR) systems, significantly optimizing clinical processes and operational efficiency.




