STRESZCZENIE

Współczesne modele automatycznego rozpoznawania mowy (speech-to-text) mają trudności z dokładną transkrypcją nazw polskich produktów farmaceutycznych, co stanowi barierę w rozwoju systemów zautomatyzowanej dokumentacji medycznej. Rozwiązanie tego problemu jest kluczowe, ponieważ odciążenie lekarzy z administracyjnych obowiązków związanych z ręcznym sporządzaniem notatek pozwala im na szybsze i dokładniejsze przeprowadzanie badań oraz pełne skupienie się na pacjencie.

W niniejszym badaniu wykorzystano model OpenAI Whisper, który został przeszkolony na w pełni syntetycznym zbiorze danych, stworzonym od podstaw bez dostępu do specjalistycznych baz medycznych czy farmaceutycznych. Podkreśla to elastyczność w projektowaniu tego typu systemów, wykazując w szczególności wysoką opłacalność oraz szybszy cykl wdrożeniowy.

Model przetestowany na danych syntetycznych oraz nagranych przez ludzi z powodzeniem rozpoznaje 7543 komercyjne nazwy leków, podczas gdy 455 nazw nie jest wykrywanych, a 382 są wykrywane częściowo. W testach przeprowadzonych wyłącznie w warunkach rzeczywistych na reprezentatywnej próbie 30 zróżnicowanych fonetycznie nazw przy użyciu dynamicznych danych niesyntetycznych system osiągnął średni wynik miary F1 na poziomie 87,4%.

Opracowany model automatycznego rozpoznawania mowy (ASR) stanowi fundament kompleksowego rozwiązania opartego na Agentic AI, stworzonego z myślą o polskich placówkach medycznych. W praktycznym kontekście klinicznym umożliwia on automatyczne wprowadzanie dokumentacji medycznej bezpośrednio do systemów Elektronicznej Dokumentacji Medycznej (EDM), co znacząco optymalizuje procesy kliniczne i efektywność operacyjną.