Kineski model od 27 milijardi parametara stane u 6 gigabajta

Kineski model od 27 milijardi parametara stane u 6 gigabajta
0
0

Model je objavljen 17. rujna 2026. pod licencom Apache 2.0, a težine su besplatno dostupne na Hugging Faceu. Radi se o ternarnoj kvantizaciji: svaki se parametar svodi na tri vrijednosti, −1, 0 ili +1, čime se u prosjeku dolazi do 1,75 bita po parametru. Klasična verzija istog modela u FP16 formatu zauzima oko 54 gigabajta, a uobičajena Q4 kvantizacija još 17,1 gigabajt — što znači da ne stane u 16 gigabajta VRAM-a grafičke kartice poput Nvidijine RTX 4070 Ti SUPER. Komprimirana verzija od 5,95 gigabajta stane bez problema.

U testu su sudjelovala četiri stroja: mini PC s Intelovim Core Ultra procesorom i Arc grafikom te 64 gigabajta podijeljene memorije, Mac mini M6 s 24 gigabajta unificirane memorije, igraće računalo s RTX 4070 Ti SUPER i 16 gigabajta VRAM-a te kontrolni mini PC s AMD Ryzen AI Max+ 395 i 128 gigabajta memorije. Rezultati su porazni za Intel: 1,75 tokena u sekundi, dok je Mac mini proizvodio 18,1, a Nvidia gotovo 69 tokena u sekundi.

Zašto ista datoteka radi 39 puta brže na jednoj kartici

Razlika nije u modelu — datoteka je identična na svim strojevima, kao i verzija Prism ML-ovog runtimea. Razlika je u backendu i načinu na koji hardver obrađuje ternarne operacije. Pod CUDA-om (Nvidijin backend) i Metalom (Appleov) komprimirani Bonsai 2 pobjeđuje klasičnu Q4 kvantizaciju. Na Intelu pod Vulkanom Q4 vraća prednost. AMD-ov stroj mjeren je dvaput, jednom pod Vulkanom i jednom pod ROCm-om, što dodatno komplicira sliku.

Prism ML tvrdi da model postiže do 143 tokena u sekundi na RTX 5090 i 46,8 na čipu M5 Max. Izmjerenih 69 tokena na RTX 4070 Ti SUPER i 18 na Mac miniju M6 u tom kontekstu djeluju logično — radi se o znatno skromnijem hardveru.

Ono što test ne pokazuje jest kvaliteta modela. Jedan stvarni test na problemu vjerojatnosti dao je točan odgovor na svim strojevima, što potvrđuje da nijedan ne halucinira u toj mjeri da proizvodi besmislice. No to je jedan zadatak, a ne ocjena modela.

Ovdje se otvara pitanje koje test zaobilazi: ako kineski model od 27 milijardi parametara stane u datoteku manju od šest gigabajta i vrti se lokalno na prosječnom računalu, tko onda uopće kontrolira što taj model radi i s kojim podacima? Model je besplatan, ali zahtijeva Prism ML-ov vlastiti runtime — ne pokreće se jednim klikom u standardnom LM Studiju ili Ollamu. To znači da američki startup stoji između kineskih težina i korisnikova računala.

Za korisnike to je pitanje od praktične važnosti. Lokalno pokretanje znači da podaci ne odlaze u oblak, ali i da nema nikakvog nadzora nad tim što je model naučio i čemu služi. Isti princip kao i kod svake druge tehnologije koja dolazi izvan naših granica: preuzimamo alat, a ne znamo tko ga je kalibrirao.

Kad se na jednoj te istoj kartici dogodi da joj oduzmete posao i ona pritom ubrza 57 posto, vrijeme je da prestanemo gledati samo broj jezgri i količinu memorije. Test lokalnog pokretanja velikog kineskog modela Bonsai na četiri različita stroja pokazao je nešto što proizvođači hardvera nerado ističu: softver odlučuje o brzini jednako kao i željezo.

Najkontraintuitivniji slučaj dolazi s Nvidia RTX 4070 Ti SUPER. Kvantizirani model Q4 teži 17,1 GB, a kartica ima 16 GB video memorije. Ne stane cijeli. Runtime je ipak tvrdio da je svih 66 slojeva poslano na GPU i test je završio na 11,0 tokena u sekundi. No dnevnik je govorio drugačije: ni megabajt slobodne memorije na kartici, a 682 MB težine ostalo je u sistemskoj RAM memoriji. Video memorija bila je zakrčena, dio modela čekao je u sporijoj DDR5 memoriji i gušio karticu.

Rješenje je bilo gotovo smiješno jednostavno. Tri sloja od 66 prepuštena su procesoru, koji ih računa iz 32 GB sistemske memorije, umjesto da ih kartica dohvaća pri svakoj riječi. Protok je skočio na 17,3 tokena u sekundi. Oduzeli smo grafičkoj kartici posao i ona je ubrzala, jer smo joj vratili malo memorijskog prostora. S karticom od 24 ili 32 GB model bi stao cijeli na GPU i bio bi znatno brži.

Ista kutija, pet puta brže

Mini računalo s AMD čipom daje najbolju lekciju. Isti testovi, iste datoteke, iste postavke — promijenjen je samo pozadinski sloj, takozvani backend. S Vulkanom Bonsai radi 3,95 tokena u sekundi, a s ROCm-om 21,57. Pet i pol puta brže, bez diranja ijedne komponente.

U istom razdoblju Q4 se gotovo ne mijenja, s 12,67 na 12,45 tokena. Poredak se preokreće na mjestu: pod Vulkanom Q4 je 3,2 puta brži od Bonsaija, a pod ROCm-om Bonsai preuzima vodstvo s 1,73 puta većom brzinom. Ne treba iz toga izvući zaključak da ROCm pobjeđuje u svim okolnostima — s modelom Gemma 4 isti autor bilježi obrnuto, Vulkan je brži.

Prava poanta je da brzina ovisi o dostupnim kernelima za konkretan format težina, jednako kao o količini memorije ili sirovoj snazi čipa. Pokrivenost Vulkana oduvijek je bila neravnomjerna, a ternarni format očito još nije najbolje optimiziran na tom putu.

Ovdje treba biti pošten prema samom modelu. Test je pokrenuo samo jedan zadatak zaključivanja i on je uspio svugdje, što nije dovoljno za ocjenu kvalitete. Proizvođač tvrdi prosjek 84,78 na 14 mjerenja u načinu zaključivanja, dok puna FP16 verzija drži 86,32 — dakle 98,2 posto izvornih sposobnosti. No neovisni test u stvarnim uvjetima bio je manje blagonaklon: model je propustio namjerno skriveni bug u aplikaciji i vrtio se u krug na prijevodu na tamilski. Prelaskom s Qwen 3.8 na Bonsai 2 gubi se dio sposobnosti zaključivanja.

Zašto ovo nije samo test za entuzijaste

Za čitatelja pitanje nije koji token u sekundi, nego tko uopće kontrolira alate. Lokalno pokretanje modela znači da podaci ne idu na tuđi poslužitelj, ali i da cijeli lanac — čip, upravljački programi, backend, format težina — dolazi iz nekoliko stranih korporacija koje same odlučuju što će optimizirati, a što neće.

To je isti obrazac koji vidimo kod bankarskog sustava i energetike: infrastruktura je u rukama drugih, a mi samo plaćamo račun. Ako država ne razvija vlastite tehnološke temelje, svaka sljedeća optimizacija doći će nam kao tuđa usluga, s tuđim uvjetima i tuđom cijenom.

Vulkan je otvoreni standard i upravo zato zaslužuje pažnju domaćih programera. Njegova neujednačena pokrivenost nije prirodna nepogoda, nego posljedica toga što proizvođači ulažu u vlastite zatvorene ekosustave. Dokle ćemo graditi vlastitu tehnološku autonomiju na tuđim backendima, ako nitko ne pita zašto naši fakulteti i instituti ne rade na vlastitim kernelima?

Francuski startup Prism ML ponovno je pomaknuo granice onoga što se može izvesti na osobnom računalu. Nakon što su prije nekoliko mjeseci uspjeli ugurati model od 54 gigabajta s 27 milijardi parametara u iPhone, bez ikakvog oslanjanja na oblak, sada su isti princip primijenili na stolna i prijenosna računala. Rezultat je lokalna umjetna inteligencija koja radi na Macu i PC-u, a da pritom ne šalje ni jedan jedini podatak na poslužitelje u inozemstvu.

To nije samo tehnički podvig. To je pitanje kontrole. Svaki put kada upišete upit u neki od popularnih chatbotova, vaš tekst putuje u podatkovne centre u Sjedinjenim Državama, Kini ili Irskoj. Tamo se obrađuje, pohranjuje i, u konačnici, koristi za treniranje budućih modela. Lokalno pokretanje modela tu praksu prekida. Vaši podaci ostaju na vašem disku.

Prism ML nije objavio koliko točno parametara ima njihov novi model ni na kojim je sve platformama testiran. Nisu odgovorili ni na pitanje je li im za treniranje trebala ikakva pomoć kineskih ili američkih partnera. A upravo je to pitanje koje bi svaka država koja razmišlja o vlastitoj tehnološkoj autonomiji trebala postaviti prije nego što se uključi u utrku.

Hardverkvantizacijalokalni AIQwenumjetna inteligencija

Stavovi izneseni u tekstu i u komentarima ne odražavaju nužno stav redakcije.

Pretplatiti se
Obavijesti o
0 Komentari
Najstariji
Najnoviji Najviše komentiran
© 2026 – Portal Logično

POVEZANE VIJESTI