Kateri AI model najbolje piše slovensko? Test, ki ga naredite sami v 20 minutah
Kateri AI model najbolje piše slovensko?
Vprašanje slišimo na vsaki delavnici: "Kateri model naj vzamemo za slovenščino?" Pričakovan odgovor je ime. Pošten odgovor je metodologija – in razlog je preprost.
Vsaka lestvica najboljših modelov zastara v nekaj tednih. Ponudniki objavljajo nove različice mesečno, pogosto brez spremembe imena, in model, ki je marca pisal najboljšo slovenščino, avgusta morda ni več isti model. Objaviti številko tipa "Claude 91 %, ChatGPT 88 %" bi pomenilo objaviti podatek s pretečenim rokom.
Zato v tem članku dobite nekaj bolj trajnega: test s šestimi nalogami in točkovnikom, ki ga na svojih besedilih izvedete v dvajsetih minutah in ponovite, kadar izide nova različica. Odgovor bo veljal za vaše podjetje, ne za povprečje.
Zakaj objavljeni benchmarki na to vprašanje ne odgovorijo
Javne primerjalne lestvice merijo večinoma angleščino, matematiko in programiranje. Tudi večjezični testi slovenščino praviloma pokrivajo skozi prevode nalog, kar meri razumevanje, ne pisanja.
Za vas pa je pomembno nekaj tretjega: ali model napiše dopis stranki, ki ga lahko pošljete brez lektorja. To je jezikovna, ne logična sposobnost, in med modeli se razlikuje precej bolj kot rezultati na splošnih testih.
Druga past: vprašanje ni le "kateri model", ampak "kateri model pri kateri nalogi". Model, ki najbolje prevaja, ni nujno tisti, ki najbolje piše prodajno besedilo, in obratno.
Kaj v slovenščini dejansko odpove
Preden testirate, morate vedeti, kaj gledati. To je devet mest, kjer jezikovni modeli v slovenščini najpogosteje spodrsnejo – po naših izkušnjah pri delu s slovenskimi besedili:
- Dvojina. Najbolj zanesljiv pokazatelj kakovosti. Modeli, učeni pretežno na angleščini, dvojino pogosto obidejo z množino ("dva zaposlena so" namesto "dva zaposlena sta").
- Sklanjanje tujih lastnih imen. "z Microsoftom", "v Googlu", "brez Shopifyja" – zelo pogosto ostane nesklonjeno.
- Spol pri poklicih in nazivih. Neskladje med "direktorica je odločil" se pojavi predvsem v daljših besedilih, kjer se model "pozabi".
- Doslednost vikanja. Besedilo se začne z vikanjem in po tretjem odstavku zdrsne v tikanje.
- Kalki iz angleščine. "naslavljati izziv" (address a challenge), "dostaviti rezultate" (deliver results), "na dnevni bazi" (on a daily basis).
- Struktura povedi. Dobesedni prevod angleškega besednega reda: pravilno, a takoj prepoznavno kot prevod.
- Zapisi številk in datumov. Decimalna vejica, presledek pred €, oblika datuma, tisočice s piko.
- Narekovaji. Slovenski „spodaj-zgoraj" proti angleškim.
- Deležniki na -oč/-ajoč. Prekomerna raba ("upoštevajoč", "izhajajoč iz") je znamenje prevoda, ne slovenskega izvirnika.
Prvi dve točki sta najbolj uporabni: če model zanesljivo obvlada dvojino in sklanja tuja imena, bo praviloma dober tudi drugod.
Test: šest nalog
Vsakemu modelu dajte iste naloge, v novem pogovoru, brez dodatnih navodil in brez popravkov. Uporabite svoje resnične dokumente, kjer je to mogoče – anonimizirane.
Naloga 1: dvojina pod pritiskom
Napiši kratko obvestilo za zaposlene (do 120 besed) o tem, da sta se
naši dve poslovni enoti združili in da bosta odslej delovali pod
enotnim vodstvom. Omeni, da sta oba vodji ostala v podjetju.
Kaj ocenjujete: vse dvojinske oblike (sta, bosta, oba vodji). Vsaka napačna množina je odbitek.
Naloga 2: sklanjanje in terminologija
Napiši odstavek o tem, kako smo podatke iz Salesforcea prenesli v
Shopify in jih povezali z Google Analytics 4. Namenjeno je vodstvu,
ne tehnikom.
Kaj ocenjujete: "iz Salesforcea", "v Shopify", "z Google Analyticsom 4" ali dosledna, smiselna alternativa. Nesklonjena imena sredi stavka so odbitek.
Naloga 3: prevod brez vonja po prevodu
Vzemite odstavek angleškega besedila iz svoje panoge in dodajte:
Prevedi v slovenščino za poslovnega bralca. Vikanje. Prevod naj se
bere kot izvirnik, ne kot prevod.
[prilepi angleški odstavek]
Kaj ocenjujete: kalke, besedni red, ali bi besedilo lahko poslali stranki brez posega.
Naloga 4: dolg dokument in doslednost
Napiši ponudbo za [vaša storitev] za stranko [tip stranke].
Dolžina okoli 500 besed, vikanje, brez fraz "v današnjem hitrem svetu".
Kaj ocenjujete: ali vikanje in spol zdržita do konca, ali se terminologija med odstavki ne spreminja (isti izraz vsakič enako).
Naloga 5: razumevanje slovenskega konteksta
Katere obveznosti ima slovensko podjetje z 12 zaposlenimi pri objavi
politike zasebnosti na spletni strani? Če česa ne veš zanesljivo, to napiši.
Kaj ocenjujete: ali model pozna slovenski in evropski okvir ali podtakne ameriške pojme (CCPA, "attorney"). In predvsem: ali prizna negotovost. Model, ki si samozavestno izmisli člen zakona, je v poslovni rabi nevaren, ne glede na to, kako lepo piše.
Naloga 6: uredniški popravek
Popravi spodnje besedilo. Označi vsak popravek in ga na kratko utemelji.
Ne prepisuj besedila na novo – popravi samo napake.
[prilepi besedilo z namernimi napakami: napačna dvojina, nesklonjeno
tuje ime, zdrs iz vikanja v tikanje, angleški kalk]
Kaj ocenjujete: koliko podtaknjenih napak model najde in ali izmišlja napake, ki jih ni. Ta naloga najbolje loči modele med seboj.
Točkovnik
Za vsako nalogo dodelite 0, 1 ali 2 točki:
- 0 – napaka, ki bi jo stranka opazila
- 1 – uporabno po manjšem popravku
- 2 – bi poslal brez posega
| Naloga | Model A | Model B | Model C | Model D |
|---|---|---|---|---|
| 1. Dvojina | ||||
| 2. Sklanjanje imen | ||||
| 3. Prevod | ||||
| 4. Dolg dokument | ||||
| 5. Slovenski kontekst | ||||
| 6. Uredniški popravek | ||||
| Skupaj (max 12) |
Dodajte še dva stolpca, ki nista jezikovna, a odločata o izbiri: cena na mesec in ali podatki smejo iz hiše.
Rezultat pod 7 pomeni, da model za slovensko poslovno komunikacijo brez lektoriranja ni primeren. Rezultat 10 ali več pomeni, da je ozko grlo vaš prompt, ne model – takrat poglejte vodič o pisanju promptov.
Kaj boste najverjetneje ugotovili
Rezultatov ne moremo napovedati namesto vas, iz izkušenj pri delu s slovenskimi besedili pa lahko izpostavimo tri vzorce, ki so razmeroma stabilni:
Največji modeli so za slovenščino opazno boljši od majhnih. Razlika med vodilnimi ponudniki (OpenAI, Anthropic, Google) je pri naših nalogah običajno manjša od razlike med njihovimi vrhunskimi in cenejšimi, hitrejšimi različicami istega ponudnika. Če varčujete z izbiro manjšega modela, prvo plača slovnica.
Odprtokodni modeli srednje velikosti so v slovenščini šibkejši. Modeli, ki jih poganjate lokalno na skromni strojni opremi, imajo bistveno manj slovenskih podatkov v učni množici. To ne pomeni, da so neuporabni – za razvrščanje, iskanje po dokumentih in povzemanje so pogosto povsem dovolj, medtem ko je pisanje besedil za stranke druga zgodba. Več o tem v članku o lokalnih LLM za slovenska podjetja.
Dvojina je razlikovalec. Če iščete eno samo hitro preverbo brez celotnega testa, uporabite nalogo 1. Zelo zanesljivo napove uvrstitev v ostalih petih.
Dodaten praktičen podatek: slovensko besedilo porabi več tokenov kot enako dolgo angleško – tokenizatorji so optimizirani za angleščino, sklanjane oblike pa se razbijejo na več delov. Če boste model uporabljali prek API-ja, to neposredno vpliva na strošek; izračunate ga z našim LLM Token Counter ali preberete v vodiču o cenah API-jev.
Kako iz rezultata narediti odločitev
Test vam da uvrstitev, odločitev pa ima še tri dimenzije:
| Merilo | Vprašanje, ki ga postavite | Zakaj šteje |
|---|---|---|
| Jezik | Kolikšen je rezultat testa? | Določa, koliko lektoriranja bo potrebnega |
| Zasebnost | Smejo podatki, ki jih vnašamo, iz hiše? | Odloči med oblakom in lokalnim modelom |
| Integracija | Ali se poveže z orodji, ki jih že imamo? | Model brez dostopa do vaših podatkov rešuje polovico naloge |
| Strošek | Naročnina na uporabnika ali plačilo po porabi? | Pri neenakomerni rabi je razlika velika |
Pogost izid pri slovenskih podjetjih: en model v oblaku za pisanje in prevajanje, lokalni model za gradivo, ki ne sme iz hiše. To ni kompromis, ampak razumna delitev dela.
Ponovite čez pol leta
Test shranite skupaj s prompti in vzorčnim besedilom iz naloge 6. Ob vsaki večji posodobitvi modela ga ponovite – vzame dvajset minut in vas obvaruje pred tem, da leta plačujete orodje, ki je medtem prehiteto.
Če besedila po testu še vedno zvenijo strojno, težava običajno ni model, ampak prompt in kasnejša obdelava. Pomaga naš AI Humanizer in vodič o naravnem AI besedilu.
Pogosta vprašanja
Kateri AI model najbolje piše slovensko? Zanesljivega trajnega odgovora ni – vodilni modeli se menjajo z vsako posodobitvijo. Praviloma najboljše slovenske rezultate dajejo najzmogljivejše različice velikih ponudnikov (OpenAI, Anthropic, Google), medtem ko manjši in odprtokodni modeli srednje velikosti bistveno pogosteje grešijo pri dvojini in sklanjanju. Namesto zaupanja lestvici izvedite šestnalogni test na svojih besedilih.
Zakaj v tem članku ni tabele z rezultati in odstotki? Ker bi bila po nekaj tednih napačna, mi pa ne objavljamo številk, ki jih ne moremo vzdrževati. Metodologija ostane uporabna tudi čez leto dni, konkretna uvrstitev pa ne.
Ali obstaja model, narejen posebej za slovenščino? Obstajajo jezikovni viri in modeli, prilagojeni slovenščini, ki nastajajo v raziskovalnem okolju. Za splošno poslovno rabo so danes praviloma še vedno šibkejši od vrhunskih večjezičnih modelov, so pa zanimivi za specializirane naloge in za rabo brez pošiljanja podatkov v oblak.
Kaj je najhitrejši način, da preverim, ali model obvlada slovenščino? Prosite ga za obvestilo o dveh poslovnih enotah in dveh vodjih (naloga 1). Napake v dvojini se pokažejo takoj in zelo dobro napovedujejo ostale.
Ali lahko slabši rezultat popravim z boljšim promptom? Delno. Prompt lahko odpravi doslednost vikanja, ton in terminologijo (z glosarjem), ne more pa modela naučiti dvojine, če je nima. Slovnične napake so lastnost modela, slog je lastnost prompta.
Ali je za slovenščino bolje pisati prompte v slovenščini ali angleščini? Za slovenski izhod pišite navodila v slovenščini – model se lažje "zasidra" v ciljni jezik in manj pogosto zdrsne v angleške strukture. Pri zelo kompleksnih navodilih je sprejemljiva kombinacija: navodila v angleščini, izrecna zahteva po slovenskem izhodu.
Zaključek
Na vprašanje "kateri model je najboljši za slovenščino" ni odgovora, ki bi zdržal eno leto. Obstaja pa test, ki zdrži – šest nalog, dvanajst točk, dvajset minut.
Naredite ga na svojih besedilih, zapišite rezultat z datumom in ga ponovite ob naslednji večji posodobitvi. To je edina primerjava, ki dejansko velja za vaše podjetje.
Sorodno branje: 10 promptov, ki vam prihranijo uro na dan, lokalni LLM za slovenska podjetja in koliko stane uporaba Claude, ChatGPT in Gemini API.
Če želite, da test izvedemo na vaših dokumentih in vam pripravimo priporočilo z izračunom stroškov, stopite v stik.
🛠 Uporabite orodje, ki spremlja ta vodič
AI Humanizer — brezplačno orodje, ki implementira priporočila iz tega članka.
Odprite AI Humanizer →