Izdata zvanična verzija DeepSeek V4, Responses API se savršeno uklapa u Codex
Baš danas, DeepSeek je ažurirao API dokumentaciju i V4-Flash zvanična verzija je izašla u javni beta.

Arhitektura i veličina modela DeepSeek-V4-Flash-0731 ostaju iste kao kod DeepSeek-V4-Flash-Preview, samo je ponovo sproveden post-trening.
Arhitektura nije menjana, veličina nije menjana, i dalje je 284B ukupnih parametara, 13B aktivacionih parametara. Ali su Agent sposobnosti znatno ojačane, a rezultati benchmark-a daleko prevazilaze V4-Pro-Preview.
01. Šta je zapravo promenjeno ovaj put
Ovaj put je ažuriran samo API interfejs DeepSeek-V4-Flash, dok DeepSeek-V4-Pro API, kao i modeli u APP/WEB klijentu nisu menjani.

Ovde treba objasniti podelu rada između pre-treninga i post-treninga.
Pre-trening je ono što model nauči čitajući ceo internet — svetsko znanje, jezičke pravilnosti, sintaksa koda, sve to ulazi u ovoj fazi. Post-trening je sloj koji na toj osnovi uči model kako da radi — obuhvata nadgledano finopodešavanje i reinforsment learning, a sadržaj koji se predaje su obrasci ponašanja: šta prvo uraditi po prijemu zadatka, kada pozvati alat, šta raditi kad alat prijavi grešku, pod kojim uslovima se može proglasiti završetak.
Pre-trening određuje koliko model zna, post-trening određuje da li model ume da radi.

Ova Flash zvanična verzija menja drugu polovinu.
02. Zašto 13B aktivacija pretiče 49B
Zašto samo izmena post-treninga omogućava Agent benchmark-u da pretiče Pro preview verziju čija je aktivacija četiri puta veća?
Setite se kako vi koristite agenta. Dobije zadatak, na primer da pronađe i popravi grešku u nekom modulu, i mora da odradi sledeće korake.
Prvo proceni koje fajlove treba pogledati, zatim pozove alat za čitanje fajlova, posle čitanja iz gomile izlaza izabere korisne delove, proceni da li ima dovoljno informacija, ako nema čita još, ako ima kreće na izmenu, izmenu prati test, ako test ne prođe vraća se na prethodni korak, a zaustavlja se tek kad test prođe.
U ovom celokupnom toku, faza u kojoj je potrebno svetsko znanje zapravo je malo.
Ono što zaista odlučuje o uspehu je drugo. Da li je alat dobro izabran, da li su parametri potpuno popunjeni, da li se iz gomile sadržaja koju vrati alat mogu izvući one ključne linije, da li posle neuspeha pokušava drugačije umesto da uporno udara na isto mesto, i najvažnije — da li zna kada da stane.

Sve su to obrasci ponašanja, i sve su u post-treningu.
Dok agent radi, većina informacija potrebnih mu dolazi iz fajlova koje sam pročita i rezultata koje vrate alati, a ne iz onoga što model nosi u sebi.
U Agent scenariju, granična korist aktivacionih parametara znatno je niža nego u scenariju pitanja i odgovora.

Prvo, pri izboru modela ne gledajte samo veličinu parametara — pri Agent tipovima zadataka, razlika između manjeg i većeg modela istog dobavljača može biti znatno manja nego što bi se parametarski odnos naslućivao, dok je razlika u ceni sasvim konkretna.
Drugo, kad vaš sopstveni agent ne radi stabilno, nemojte odmah menjati veći model. Prođite kroz gorenavedeni tok korak po korak: da li su opisi alata jasno napisani, da li postoji retry pri neuspehu, da li se kontekst vremeno skraćuje — korist od ovih koraka često je veća od zamene modela.
03. Pokrenimo benchmark
Ovaj put u logu izmena dato je devet benchmark rezultata. Izađimo odmah sa svima.
| Benchmark | Rezultat |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| Cybergym | 76.7 |
| Toolathlon verified | 70.3 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
| DeepSWE | 54.4 |
| NL2Repo | 54.2 |
| Agent Last Exam | 25.2 |
| Automation Bench (Public) | 25.1 |

Devet benchmark-ova se grubo može podeliti u tri kategorije.
Terminal i softversko inženjerstvo, uključujući Terminal Bench 2.1, DeepSWE i NL2Repo — provera razvojnih zadataka u terminalnom okruženju i stvarnim repozitorijumima koda. Pozivanje alata i automatizacija, uključujući Toolathlon verified, Automation Bench i Agent Last Exam — provera koordinacije više alata i dugačkih tokova zadataka. Full-stack razvoj, što su dve DSBench stavke, a zvanično je naznačeno da je u pitanju interni test set.
Rezultat je zapravo od manjeg značaja jer varira sa uslovima testiranja — ako uslovi nisu jasno navedeni, rezultati se ne mogu porediti.
Zvanična konfiguracija testiranja glasi ovako: javni benchmark testovi koriste DeepSeek Harness minimalni režim.
Reč Harness zahteva objašnjenje. Ona označava onaj sloj skele oko modela — Claude Code je koristan ne samo zato što prompt prosleđuje modelu, već zato što je između dodao razlaganje zadataka, čitanje i pisanje fajlova, terminalne operacije, automatsko ispravljanje grešaka. Taj sloj sposobnosti je Harness.

Isti model, u različitim Harness-ima, može se ponašati drastično različito.
Obrnuto, u istom Harness-u se zamenom različitih osnovnih modela može jasno videti razlika među modelima. To je uobičajen način da procenimo sposobnosti modela.
Zato prilikom pokretanja benchmark-a izbor Harness-a direktno određuje koliko u rezultatu doprinosi model, a koliko skele. Dovoljno pametan Harness može pokriti mnogo problema modela — model zaboravi retry, Harness radi retry za njega; model pogreši format izlaza, Harness to ispravi.
Moj zaključak je da objavljivanje rezultata sa minimalnim Harness-om pokazuje da DeepSeek želi da naglasi kako ove rezultate uglavnom doprinosi sposobnost samog modela, a ne pokrivanje spoljnim okvirom.
Kada inače vidite da neki model ima prelepe rezultate benchmark-a, a u vašem projektu ne dostiže taj nivo — uobičajen razlog je što je Harness koji je on koristio znatno jači od onog koji smo mi sami podigli.

A rezultati iz minimalnog Harness-a obično imaju manji pad.
04. Nativna podrška za Responses API
U ovoj isporuci postoji još jedna stavka za koju smatram da zaslužuje posebnu pažnju.
Zvanična verzija V4-Flash nativno podržava Responses API format i ciljano je prilagođena Codex-u.
Da bismo pojasnili zašto je ovo važno, moramo prvo razjasniti u čemu se Responses API razlikuje od onog interfejsa koji dobro poznajemo.
Većina vas za pozivanje velikog modela (LLM) uglavnom koristi Chat Completions format — niz messages se pošalje, a model vraća deo sadržaja. Ovaj interfejs je bez stanja: u svakoj rundi razgovora moramo ponovo sastaviti celu prethodnu istoriju u messages i poslati je još jednom.
Responses API je drugi interfejsni format koji je OpenAI kasnije izdao, sa dve ključne razlike.
Prvo — može biti sa stanjem: server pamti odgovor prethodne runde, tako da sledeća rundu može direktno referencirati response ID i nastaviti dalje, bez ponovnog slanja cele istorije.
Drugo — ima namensku strukturiranu reprezentaciju procesa zaključivanja i pozivanja alata. Process razmišljanja modela, zahtev za poziv alata, rezultat koji vraća alat — u ovom formatu su to zasebne stavke, umesto da budu sabijeni u jedan tekst i ugurani u messages.
Druga stavka je za agenta naročito kritična.

Jer kad agent radi dugi zadatak, proces zaključivanja modela mora da se prenosi između rundi. U jednoj rundi model shvati „koreni uzrok ove greške je u konfiguracionom fajlu", i u sledećoj rundi treba to da pamti, umesto da iznova izvodi od nule.
Prosleđivanje takvih informacija preko Chat Completions-a zahteva da srednji sloj serijalizuje proces zaključivanja u tekst i vrati ga nazad — pri čemu lako dolazi do gubitaka.
Zato savremeni terminalski agent alati, u šta spada i Codex, koriste Responses API protokol.
Ako neki model nudi samo Chat Completions interfejs, da bi se priključio na Codex potrebno je dodati sloj za konverziju protokola — zahtev u Responses formatu se prevodi u Chat Completions, a povratni rezultat nazad. Pisati tu konverziju nije teško, ali problem je što je sa gubitkom — strukturirane informacije procesa zaključivanja i pozivanja alata se u konverziji lako spljošte.
Nativna podrška znači da taj konverzioni sloj nije potreban.
Uz još zvanično pomenuto ciljano prilagođavanje Codex-u, moje razumevanje je da se ne samo poklapa format protokola, već je model u fazi post-treninga posebno vežbao Codex-ove konvencije alata i navike interakcije.

05. Cenovnik i peak/off-peak određivanje cena
Jedinica je juan po milion tokena.
| Stavka | V4-Flash | V4-Pro |
|---|---|---|
| Dužina konteksta | 1M | 1M |
| Maksimalni izlaz | 384K | 384K |
| Ulaz (pogodak u keš) | 0.02 | 0.025 |
| Ulaz (promašaj keša) | 1 | 3 |
| Izlaz | 2 | 6 |
| Ograničenje konkurencije | 2500 | 500 |

U ovoj tabeli smatram da red pogotka u kešu zaslužuje najviše pažnje — 0.02 juana po milion tokena.
U poređenju sa jednim juanom za promašaj keša, razlika je pedeset puta.
Zašto je ovaj red posebno važan u Agent scenariju? Zato što agent, dok radi, u svakom zahtevu nosi veliki deo sadržaja koji se ponavlja — sistemski prompt, definicije alata, opis strukture projekta, istorija razgovora iz prethodnih rundi. Ti sadržaji se u desetak rundi zahteva unutar jednog zadatka prenose iznova.
Ako ovaj deo pogodi keš, stvarni račun i u slučaju promašaja mogu se razlikovati za red veličine.
Na kraju, novo pravilo na koje ovaj put treba obratiti pažnju — peak/off-peak određivanje cena.
Zvanična stranica za cene navodi da je cena u periodu najvećeg opterećenja dvostruko veća od redovne, u periodu svakog dana od 9:00 do 12:00 i od 14:00 do 18:00 po pekinškom vremenu.

Ta dva perioda upravo padaju u vreme kad svi radite.
06. Kako se priključiti
Prema zvaničnoj dokumentaciji, DeepSeek-ov interfejs je kompatibilan sa OpenAI formatom, Base URL je https://api.deepseek.com, a za ime modela navedite deepseek-v4-flash i dobijate ovu zvaničnu verziju. API ključ se zahteva na DeepSeek open platformi.
Zato svaki alat koji podržava prilagodljiv OpenAI-kompatibilni interfejs ima istu trojku konfiguracije: Base URL, API ključ i ime modela.
Sa Codex strane, zahvaljujući nativnoj podršci za Responses API, konfiguracija može direktno da pokazuje na DeepSeek-ov interfejs, bez srednjeg sloja za konverziju protokola.

ending
Kostur zvanične verzije V4-Flash potpuno je isti kao kod aprilskog preview izdanja, sve promene potiču od ponovo urađenog post-treninga, a poboljšanje Agent sposobnosti uglavnom dolazi iz tog sloja — to nas samo po sebi podseća da agentov uspeh ne zavisi samo od jednog faktora — veličine modela.
Nativna podrška za Responses API i prilagođavanje Codex-u. To znači da model sa niskom cenom i ograničenjem konkurencije od 2500 može direktno da se ubaci u glavne Agent alate, bez posrednog sloja za konverziju protokola.
Otvorite log zahteva vašeg Agent projekta i pogledajte da li se sistemski prompt i definicije alata stabilno nalaze u prefiksu zahteva.

Zvaničnu Pro verziju čekamo.
Vidimo se u sledećem izdanju.
