Tačnost
Šta je izmjereno, šta stvarno pomaže, i šta se samo čini da pomaže.
Dictolo je podešen na osnovu mjerenja, ne osjećaja. Ovo je tabela iz tog mjerenja, pa onda ono što ti možeš da promijeniš.
Izmjereno
Pet rečenica snimljenih običnim mikrofonom, model large-v3 na NVIDIA grafičkoj.
Greška se računa nad malim slovima bez interpunkcije, ali s dijakritikama — c i č
nisu ista riječ, i tu je bila pola problema.
| Podešavanje | Greška po riječima | Greška po znakovima |
|---|---|---|
| Prije | 22,6 % | 10,2 % |
| Bogatiji prompt modelu | 18,3 % | 5,1 % |
| + osjetljiviji VAD (ono što je u aplikaciji) | 14,3 % | 4,3 % |
| + popunjen lični rječnik | 10,3 % | 3,0 % |
Koliko ovo vrijedi
Pet snimaka, jedan glas, jedan mikrofon, jedna prostorija. To je dovoljno da se vidi koje podešavanje je bolje od kojeg, ali nije procjena tačnosti koju ćeš ti dobiti. Tvoj broj zavisi od mikrofona, prostorije i toga koliko razgovijetno govoriš.
Šta je pomoglo i zašto
Prompt koji model dobije prije snimka. Ovo je najveći pojedinačni dobitak — CER je
prepolovljen. Kratka rečenica tipa „ovo je diktat na bosanskom“ ne radi skoro ništa.
Prompt koji izričito nabraja č ć š ž đ, traži brojeve riječima i opisuje interpunkciju
radi. Dictolo ga nosi za svaki jezik posebno.
Osjetljivija detekcija govora. Podrazumijevani prag odsijeca rubove riječi: „pošalji“ je izlazilo kao „pošalj“. Sniženi prag i duži rub tišine oko govora to popravljaju.
Ovo dvoje su ugrađeni i ne mijenjaju se iz interfejsa.
Šta ti možeš
Postavi jezik ručno. Automatski izbor na kratkom snimku umije da odluta i time izgubi prompt za taj jezik. Vidi Jezici.
Popuni lični rječnik. Imena, firme, termini iz tvog posla. U mjerenju je to bio drugi najveći dobitak: 14,3 % → 10,3 %. Vidi Lični rječnik.
Diktiraj cijele rečenice. Model koristi kontekst. Rečenica od deset riječi se prepiše tačnije od tri odvojena snimka po tri riječi.
Provjeri mikrofon. Mikrofon u laptopu hvata prostoriju i ventilator. Slušalice s mikrofonom, makar najobičnije, su najjeftinije poboljšanje tačnosti koje postoji.
Ostani na najprecizniji modelu. Brzi model (large-v3-turbo) je brži i slabiji. Vrijedi
ga uzeti samo ako radiš na procesoru i čekanje ti je nepodnošljivo. Vidi
Postavke.
Šta ne pomaže
Ovo je isto mjereno, i nije se isplatilo:
- Isključiti detekciju govora. Gore: 25,1 %.
- Reći modelu da je hrvatski kad diktiraš bosanski. Tačno nula razlike. Ta pretpostavka je jedno vrijeme stajala u kodu i izbačena je nakon mjerenja.
- Šire pretraživanje i nulta temperatura. Nula razlike, samo sporije.
„Pouzdanost“ na početnom ekranu nije tačnost
Broj koji Dictolo pokazuje kao Pouzdanost je procjena samog modela o tome koliko je siguran u ono što je napisao. Model može biti siguran i pogriješiti, i obrnuto.
Tačnost je razlika između onoga što si rekao i onoga što je napisano, a to Dictolo ne može znati — jer ne zna šta si htio reći. Zato tu stoji „pouzdanost modela, ne mjerena tačnost“.