Alibaba i dalje udara snažno: Qwen3.8-Max zvanično objavljen.
Alibaba je zvanično objavio Qwen3.8-Max.
2.4T ukupnih parametara, podrška za ulaz slika i videa, nativno multimodalno. Kontekst od milion Token-a, maksimalni izlaz 131.000 Token-a.
Sledeće nedelje otvaraju se težine za Qwen3.8-Max i Qwen3.8-27B, što znači da ćete moći da ih postavite lokalno — haha, mada običan čovek nema takav računar.

Posle toliko objavljivanja modela u ove dve godine, sve manje sam voljan da buljim samo u parametre i rang liste. Šta modelu znači što je u tabeli pobedio u još dve stavke — za razvojni tim to ne mora mnogo da vredi.
Ono što zaista želim da znam je: da li može da se bije kada se ubaci u naš workflow, da li će izgubiti pamćenje kada odvozi više krugova i da li može sam da ispravi sopstvene greške.
01. Prvi ešalon
Qwen3.8-Max je MoE model sa 2.4T ukupnih i 95B aktiviranih parametara.
MoE se može shvatiti kao kompanija koja drži mnogo expert-a, ali pri svakom poslu ne moraju svi da stanu na scenu — prema pitanju se angažuje samo deo njih. Tako se kapacitet modela može napraviti velik, a da se za svaki Token ne aktiviraju svi parametri.

Qwen3.8-Max je namenjen Coding-u i professional work-u; podržava ulaz teksta, slika i videa, kao i Function Calling, strukturirani izlaz, Web Search, Code Interpreter i slične sposobnosti. Zvanično se čak tvrdi da može samostalno da kodira i isporuči kompletan projekat koji traje više od 10 dana.
Zvanično su data i tri načina integracije — OpenAI Chat Completions, Responses API i Anthropic API — uz primere konfiguracije za Claude Code, Codex, Qoder CLI, Qwen Code i OpenClaw.
Mogućnost rada u različitim alatima ne zavisi samo od toga da li model ume da pozove funkciju, već i od toga da li server ume da primi odgovarajući protokol, te da li se proces rezonovanja i rezultati poziva alata ispravno prenose između krugova.
Ovaj put je dodat i reasoning_effort, koji se podešava između tri nivoa — low, medium i xhigh — sa podrazumevanim xhigh; preserve_thinking je podrazumevano uključen i služi da između poziva alata u više krugova zadrži neophodno stanje rezonovanja.
Ljudski rečeno: isti model može mozak da raspodeli prema težini zadatka.
Za jednostavno menjanje teksta ili proveru polja nema potrebe svaki put uključivati najviši nivo; za složene refaktoringe i otklanjanje grešaka u dugom lancu tek onda se jačina rezonovanja podigne do maksimuma.
Napomena: rezultat dugog zadatka istovremeno zavisi od modela, Harness-a, prava alata, upravljanja kontekstom, okruženja za testiranje i stepena ljudskog uplitanja.
02. Benchmark rezultati
Zvanični materijali izlistavaju poređenje po 16 glavnih sposobnosti, pokrivajući zadatke poput softverskog inženjerstva, rada na računaru, profesionalnog radnog znanja, vizuelnog razumevanja i dugih videa.
Na PaperBench-u Qwen3.8-Max ima 93.0, više od Claude Fable 5 sa 88.8 i GPT-5.6 Sol sa 90.5; na OSWorld-Verified ima 86.1; i na vizuelnim i dugovideoskim stavkama poput ERQA, PerceptionBench i LVBench nalazi se pri vrhu.

Ali nije prvi u svakoj stavci.
Na primer, na SWE-bench Pro Qwen3.8-Max ima 67.7, a Claude Fable 5 80.0; na FrontierSWE prvi ima 73.5, drugi 88.8. Preciznije bi bilo reći: „po zvaničnoj evaluaciji, sposobnosti su uravnotežene i model ulazi u svetski prvi ešalon".
Te 16 stavki nisu jedan te isti ispit.
PaperBench je bliže razumevanju i reprodukciji naučnih radova, OSWorld-Verified gleda rad u okruženju radne površine, a SWE-bench Pro i FrontierSWE su bliže stvarnom softverskom inženjerstvu.
Timovi koji prave Code Agent treba prvo da gledaju softversko inženjerstvo i pozive alata; timovi za pregled ugovora i industrijska istraživanja pre treba da gledaju duge dokumente, pretragu i profesionalne radne zadatke.
Postoji i jedno često zanemareno pitanje: rezultati različitih modela nisu nužno postignuti pod potpuno istim Harness-om, jačinom rezonovanja i konfiguracijom alata.
Harness je upravo onaj inženjerski skelet obavijen oko modela. Claude Code, Codex, Qwen Code i OpenClaw mogu se posmatrati kao različiti Harness-i. Oni opisuju alate modelu, spajaju kontekst, obrađuju ponovne pokušaje pri neuspehu, skraćuju izlaz, pa čak i vraćaju model na pravi put kada skrene.
Isti model, u različitim Harness-ima, na kraju može imati prilično različitu stopu završetka.
Qwen je ovaj put dao posebno jedan skup Cross-Harness podataka. Kada je Qwen3.8-Max stavljen u QwenWork, Claude Code, Codex, OpenClaw, Hermes i OpenCode, CoWorkBench se kreće otprilike od 73.2 do 75.8, WorkspaceBench otprilike od 67 do 71.2, a JobBench otprilike od 53.4 do 59.8.

Smisao ovih podataka nije u tome da je „svejedno koji alat koristite". Najviši i najniži rezultat na JobBench-u i dalje se razlikuju za više od 6 poena.
Ono što zaista pokazuju je da je Qwen tim bar stavio isti model u više glavnih alata i sam testirao, umesto da da samo jedan rezultat u QwenWork-u. Po ovim zvaničnim rezultatima, posle promene Harness-a nije bilo ukupnog strmoglavog pada.
Ali zvanično nisu u potpunosti otkrivena verzija svakog skupa zadataka, nivo rezonovanja, Token budžet i strategija ponovnih pokušaja, niti se može isključiti da je model prilagođavan za pojedine Harness-e.
Prikazana je i kriva odnosa broja RL okruženja i efekta: bez treninga u okruženjima 0.474, sa oko 4000 okruženja dostiže 0.725, a daljim gomilanjem na 4500 i 5000 okruženja, naprotiv, pada na 0.719 i 0.689.

03. Zadaci dugog dometa
Zvanično je prikazan jedan autonomni projekat programiranja koji je trajao 16 dana: ukupno 265 commit-a, 127 Pull Request-ova i 151 Issue.

Ko ima potrebu da pravi sopstveni točak može odmah da pogleda source code — istog je tipa kao moj PaiCLI, radi se o terminalnom Agent-u.
„Kontekst je vrlo dug" i „dugodometni zadatak se može odvoziti do kraja" dva su različita pojma.
Kontekst od 1M samo daje modelu veću radnu površinu; to ne znači da model poseduje trajno pamćenje koje ne opada deset dana. Ako se svi logovi terminala, kompletan source code i razmišljanje iz svakog kruga naguraju unutra bez razmišljanja, i najveći prozor će se napuniti.
Za prave duge zadatke još treba znati sažeti istoriju, sačuvati plan, zabeležiti stavke prijemke koje su već prošle i ključna stanja upisati u repozitorijum, task panel ili eksternu memoriju, umesto da se drže samo u razgovoru.
04. API cena
API cena: 2 dolara po milion Token-a za ulaz i 6 dolara za izlaz; ulaz preko implicitnog keša 0.25 dolara, kreiranje eksplicitnog keša 2.5 dolara, čitanje eksplicitnog keša 0.17 dolara.

Da bi utisak bio opipljiv, po standardnoj ceni običnog API-ja izračunao sam zadatak sa 100.000 ulaznih i 20.000 izlaznih Token-a.
| Model | Ulazna cena / milion Token | Izlazna cena / milion Token | Nominalni trošak pri fiksnoj potrošnji Token-a |
|---|---|---|---|
| Qwen3.8-Max | 2 dolara | 6 dolara | 0.32 dolara |
| Gemini 3.1 Pro Preview | 2 dolara | 12 dolara | 0.44 dolara |
| Claude Opus 4.8 | 5 dolara | 25 dolara | 1.00 dolara |
| GPT-5.6 Sol | 5 dolara | 30 dolara | 1.10 dolara |
| Claude Fable 5 | 10 dolara | 50 dolara | 2.00 dolara |

Ni u poređenju sa kineskim modelima Qwen3.8-Max nije najjeftiniji. DeepSeek trenutno za V4-Pro zvanično naplaćuje 3 juana za ulaz pri promašaju keša i 6 juana za izlaz po milion Token-a — čista cena po Token-u je očigledno niža.
Pa zašto i dalje smatram da je cena ključna konkurentska snaga Qwen3.8-Max?
Zato što se trošak Agent-a ne gleda po jednom zahtevu, već po tome „koliko ukupno košta da se zadatak završi".
Model koji je po zvaničnoj evaluaciji ušao u prvi ešalon, a čija je izlazna cena manja od četvrtine cene Opus-a 4.8 — ako mu je stvarna stopa završetka dovoljno blizu — značajno snižava prag za primenu u velikom obimu.
I keš je veoma važan.
Agent u svakom krugu iznova nosi system prompt, definicije alata, opis repozitorijuma i deo istorije razgovora. Ako stabilni prefiks masovno pogađa keš, stvarni trošak ulaza padaće još dalje.
05. Vredi li prebaciti se
Ako vaši zadaci zahtevaju čitanje velikih repozitorijuma, obradu vrlo dugih dokumenata, česte pozive alata ili neprekidan rad od nekoliko sati — onda zaslužuje mesto na listi kandidata.
Kontekst od 1M, ulaz slika i videa, strukturirani izlaz, Function Calling i izlazna cena niža nego kod inostranih flagmana — sve to tačno služi ovakvim workflow-ima.
Savetujem da uzmete 20 do 50 stvarnih zadataka koje je vaš tim već završio i napravite jedan A/B test.
Fiksirate isti Harness, ista prava alata, iste timeout-e i Token budžet, a zatim beležite pet indikatora: stopa završetka zadatka iz prvog pokušaja, prosečan broj ponovnih pokušaja, broj ljudskih uplitanja, P95 vreme završetka i ukupan trošak po zadatku koji je prošao prijemku.
Skup zadataka mora bar pokriti nove funkcionalnosti, popravku starog koda, refaktoring kroz više datoteka, dopunu testova i zadatke dokumentacije; zatim se složi po težini — jednostavno, srednje i teško.
Svaki model radi na istom snapshot-u repozitorijuma, a po završetku prijemku zajedno rade automatski testovi i ljudski code review.

Mnogi dugi zadaci koji izgledaju impozantno, kada uđu u pravi tim, napuhaju troškove — problem je upravo u tom skrivenom radu koji nikad ne uđe u Token račun.
Na primer, model A svaki put potroši samo 0.2 dolara, ali mu je stopa prolaska 40%; model B svaki put potroši 0.5 dolara uz stopu prolaska 90%. Grubo preračunato po uspešnim zadacima, osnovni trošak poziva za A je 0.5 dolara, a za B 0.56 dolara — veoma su blizu. Ali kada se uračunaju čekanja na ponovne pokušaje i ljudske popravke, B na kraju može biti jeftiniji.
06. Na kraju
Najjači utisak o Qwen3.8-Max koji nosim nakon pisanja ovog teksta nije taj da se među kineskim modelima pojavio još jedan krupnjak od 2.4T.
Već to što su proizvođači modela počeli direktno da odgovaraju na tri pitanja koja razvojne timove najviše zanimaju: da li će model ostati stabilan u različitim alatima, da li može jednu stvar odvoziti do kraja i da li se račun na kraju može podneti.

Po rezultatima koje je Qwen zvanično objavio, odgovori Qwen3.8-Max-a vrlo su konkurentni: sposobnosti u prvom ešalonu, samotestiranje kroz Harness-e bez ukupnog strmoglavog pada, dovoljno impozantni primeri dugih zadataka i API cena očigledno niža od nekoliko inostranih flagmana.
Kasnije ću njime posebno provrtiti projekte koje već imam pri ruci, da vam pokažem koliko je zaista jak.
