Latviešu valoda un MI
Vai mākslīgais intelekts runā latviski?
Jā, mākslīgais intelekts latviski raksta, saprot un runā, bet ne vienādi labi visos uzdevumos. Tekstā globālie modeļi tiek galā, runas atpazīšanā rezultāts atkarīgs no ieraksta kvalitātes, bet balss ģenerēšanā rezultāts jāpārbauda ar savu tekstu: neviens ražotājs latviešu valodas kvalitāti publiski nemēra.
Cik labi MI modeļi tiek galā ar latviešu valodu?
Globālie lielie valodu modeļi latviski raksta un saprot, taču latviešu valoda to apmācības datos ir maza daļa salīdzinājumā ar angļu valodu. Praksē tas parādās niansēs: locījumos, garumzīmēs, terminos un tur, kur teikums ir garš un sarežģīts.
2025. gada rudenī Latvijas uzņēmums Tilde publicēja TildeOpen LLM — 30 miljardu parametru modeli, kura apmācībai izmantoti 29 miljardi latviešu valodas vārdu. Kopš 2026. gada februāra tas ir integrēts publiski pieejamā mašīntulkošanas platformā, kas strādā ar 34 Eiropas valodām.
Par to, cik labs tas ir salīdzinājumā ar globālajiem modeļiem, publiski ir zināmi tikai izstrādātāja paša publicētie pirmie testi. Neatkarīga salīdzinājuma latviešu valodā nav, tāpēc šos skaitļus ir godīgi lasīt kā izstrādātāja apgalvojumu, ne kā nozares mērījumu.
| Salīdzinājums | Ko apgalvo izstrādātājs |
|---|---|
| TildeOpen LLM pret GPT-4o | Par 24 % labāks latviešu valodā |
| TildeOpen LLM pret LLaMA-3 | Par 41 % labāks latviešu valodā |
| Neatkarīgs salīdzinājums | Nav publiski pieejams |
Vai MI saprot ierunātu latviešu valodu?
Runas atpazīšana latviski nav jaunums: Tildes rīks ir pieejams kopš 2016. gada, un jau tolaik tas atpazina aptuveni 80 % no ierunātā, ja ieraksta kvalitāte bija laba. Tieši šis nosacījums praksē arī izšķir rezultātu — telefona līnija, fona troksnis un vairāki runātāji pasliktina to vairāk nekā pati valoda.
Specializētās jomās notiek atsevišķs darbs. Latvijas Universitātes Matemātikas un informātikas institūta Mākslīgā intelekta laboratorija (AiLab) sadarbībā ar Rīgas Austrumu klīnisko universitātes slimnīcu veido specializētu latviešu runas korpusu — tas ir ceļš, kā valoda tiek gatavota konkrētai nozarei, ne visai pasaulei uzreiz.
Kā MI runā latviski: mūsu pašu pieredze
Šo daļu nevar nolasīt no ražotāju lapām, tāpēc rakstām no savas darba pieredzes. Mēs latviešu balsi ģenerējam klientu video regulāri, un tas, kas tur lūzt, katru reizi ir viens un tas pats:
- Skaitļi. Ja tekstā ir «300 €» vai «2026», balss to nolasa nepareizi vai mehāniski. Skaitļus rakstām vārdiem tā, kā cilvēks tos izrunātu — tas atrisina lielāko daļu problēmu.
- Garumzīmes un mīkstinājuma zīmes. Daļa rīku tās vienkārši ignorē, un iznāk sveša valoda ar latviešu vārdiem. To pamana pēc pirmajām sekundēm.
- Svešvārdi un saīsinājumi. Zīmolu nosaukumi, «CRM», «B2B» un angļu termini bieži tiek izrunāti kā latviešu vārdi. Palīdz rakstīt tos tā, kā tie skan, nevis kā tie rakstās.
- Gari teikumi. Intonācija izjūk teikuma vidū. Īsāki teikumi latviešu balsij dod vairāk nekā jebkurš iestatījums.
- Katra balss jāpārbauda ar savu tekstu. Divi rīki ar vienādu «latviešu valodas atbalstu» sarakstā skan pilnīgi atšķirīgi uz viena un tā paša teksta.
Kāpēc nevar vienkārši paskatīties, kurš rīks latviski ir labākais?
Tāpēc, ka tāda saraksta nav. Ražotāji publicē valodu sarakstus, kuros latviešu valoda ir klāt, bet publiski mērījumi par to, cik labi konkrētais rīks strādā tieši latviski un tieši uz telefona līnijas, netiek publicēti.
Praktiskā secība tāpēc ir apgriezta: nevis izvēlēties rīku pēc saraksta, bet paņemt savu reālo tekstu — vienu klienta vēstuli, vienu skriptu, vienu jautājumu telefonā — un izlaist to caur diviem trim rīkiem. Atšķirība parasti ir dzirdama uzreiz un neprasa nedēļu.
Ko mēs par latviešu valodu un MI nezinām?
Godīgi: publiski nav datu par to, cik plaši Latvijas mazie un vidējie uzņēmumi jau lieto latviski runājošus MI risinājumus un kāds no tiem ir reālais rezultāts. Nav arī publisku izmaksu datu par pielāgotiem, latviešu valodu atbalstošiem risinājumiem — cena katrā gadījumā veidojas atsevišķi.
Tāpēc šajā rakstā nav procentu par ietaupīto laiku un nav apgalvojuma, ka kāds konkrēts rīks ir «labākais latviešu valodai». Tur, kur datu nav, godīgāk ir to pateikt, nekā aizpildīt tukšumu ar skaistu skaitli.
Kas valstī notiek ar latviešu valodu MI jomā?
Nacionālo MI stratēģiju Latvijas valdība publicēja 2020. gada februārī, un 2026. gada aprīlī tika izziņota valsts mēroga iniciatīva par mākslīgo intelektu izglītības jomā ar mērķi līdz 2030. gadam uzlabot skolēnu un skolotāju prasmes.
Uzņēmumam praktiski svarīgāks ir cits datums: no 2026. gada 2. augusta ir spēkā ES MI akta caurskatāmības prasības, un tas nozīmē, ka klientam jāpasaka, ka ar viņu runā mašīna — arī tad, ja tā runā nevainojamā latviešu valodā. Ko tieši tas prasa, esam aprakstījuši atsevišķi: vai jāpaziņo, ka atbild robots.
Kā to darām mēs
Latviešu balsi mēs ģenerējam klientu reklāmas video un pārbaudām katru ierakstu ar ausīm, pirms tas aiziet klientam. Tekstu sagatavojam tā, lai balss to nolasītu pareizi: skaitļi vārdiem, īsi teikumi, saīsinājumi rakstīti pēc skanējuma.
Ja jums vajag latviski runājošu čatbotu vai e-pasta MI aģentu, pirmajā 90 minūšu konsultācijā izejam cauri jūsu reālajam tekstam un pasakām, kur latviešu valoda būs problēma un kur nē. Saruna ir bez maksas.
Avoti
- Tilde par TildeOpen LLM (05.09.2026.)
- researchLatvia par Latvijā radīto modeli (05.09.2026.)
- Kursors.lv: TildeOpen pielāgots tulkošanai (2026) (05.09.2026.)
- Kursors.lv: latviešu runas atpazīšana (2016) (05.09.2026.)
- LU MII Mākslīgā intelekta laboratorija (AiLab) (05.09.2026.)
- LU LFMI: specializēta latviešu runas korpusa izstrāde (05.09.2026.)
- Digital Skills and Jobs Platform: Latvijas nacionālā MI iniciatīva (05.09.2026.)
- EUR-Lex: ES MI akta kopsavilkums (05.09.2026.)
Biežāk uzdotie jautājumi
Vai ChatGPT labi runā latviski?
Tas latviski raksta un saprot, taču latviešu valoda tā apmācības datos ir maza daļa salīdzinājumā ar angļu valodu. Praksē tas nozīmē kļūdas locījumos, garumzīmēs un terminos, īpaši garos teikumos. Īsākiem, konkrētiem uzdevumiem rezultāts parasti ir pietiekams.
Kas ir TildeOpen LLM?
Latvijas uzņēmuma Tilde izstrādāts liels valodas modelis, publicēts 2025. gada rudenī: 30 miljardi parametru, apmācībā izmantoti 29 miljardi latviešu valodas vārdu. Kopš 2026. gada februāra tas ir integrēts publiski pieejamā mašīntulkošanas platformā, kas strādā ar 34 Eiropas valodām.
Vai TildeOpen ir labāks par ChatGPT latviešu valodā?
Izstrādātāja publicētie pirmie testi apgalvo, ka latviešu valodā tas ir par 24 % labāks nekā GPT-4o un par 41 % labāks nekā LLaMA-3. Neatkarīga salīdzinājuma latviešu valodā publiski nav, tāpēc šie skaitļi ir izstrādātāja apgalvojums, ne nozares mērījums.
Cik precīzi MI atpazīst ierunātu latviešu valodu?
Tildes runas atpazīšanas rīks ir pieejams kopš 2016. gada un jau tolaik atpazina aptuveni 80 % no ierunātā pie labas ieraksta kvalitātes. Praksē rezultātu vairāk nosaka troksnis, telefona līnija un vairāki runātāji, nekā pati valoda.
Kurš rīks latviešu balsij ir labākais?
Publiska atbilde uz šo jautājumu neeksistē: ražotāji latviešu valodas kvalitāti neizmēra un nepublicē. Vienīgais darbojošais veids ir paņemt savu reālo tekstu un izlaist to caur diviem trim rīkiem — atšķirība parasti ir dzirdama uzreiz.
Kāpēc MI balss nepareizi nolasa skaitļus latviski?
Tāpēc, ka cipari tiek nolasīti pēc noklusējuma likuma, ne pēc konteksta. Risinājums ir vienkāršs: rakstiet skaitļus vārdiem tā, kā cilvēks tos izrunātu. Tas pats attiecas uz saīsinājumiem un zīmolu nosaukumiem — tos labāk rakstīt pēc skanējuma.
Vai drīkst likt MI runāt ar klientu latviski, neko nesakot?
Nē. No 2026. gada 2. augusta ES MI akta caurskatāmības prasības nosaka, ka cilvēkam jābūt informētam, ka viņš sazinās ar mākslīgo intelektu, ne vēlāk kā pirmās mijiedarbības brīdī. Tas attiecas arī uz nevainojami runājošu latviešu balsi.
Vai ir dati par to, cik Latvijas uzņēmumu jau lieto latviski runājošu MI?
Publiski tādu datu nav. Ir zināms, cik uzņēmumu Latvijā vispār lieto MI, bet atsevišķas statistikas tieši par latviski runājošiem risinājumiem un to rezultātiem nav. Tāpēc šajā rakstā par to nav neviena procenta.
Pārbaudīsim latviešu valodu uz jūsu teksta
Atsūtiet vienu reālu tekstu — klienta vēstuli, video skriptu vai jautājumu, ko klienti uzdod pa telefonu. Bezmaksas 90 minūšu konsultācijā izlaidīsim to caur rīkiem un pateiksim, kur latviešu valoda būs problēma un kur ne.