STRESZCZENIE

Praca ocenia empirycznie wpływ trzech technik promptowania na trafność klasyfikacji wniosków o świadczenia społeczne przez lokalne modele językowe mierzoną miarą F1 macro. Są to few-shot, Chain-of-Thought oraz dostarczenie kryteriów kwalifikowalności. Badanie przeprowadzono na pięciu modelach (8-12B parametrów) w pełnym schemacie czynnikowym 3 x 2 x 2 x 2, klasyfikując 2400 syntetycznych wniosków na każdą kombinację. Schemat obejmuje dwa zbiory testowe różniące się trudnością: zbiór A z odrzuceniami zdominowanymi przez naruszenia wielokryterialne i zbiór B z odrzuceniami wyłącznie jednokryterialnymi. Dane oparte są na deterministycznych regułach kwalifikowalności Bench-Capona, co eliminuje szum pomiarowy i zapewnia pełną atrybutowalność błędów modelowi. Do wnioskowania statystycznego zastosowano procedurę bootstrapową z korektą Holma na wielokrotne porównania.