Codex sada izvorno podržava domaće modele, integrisali smo Step 3.7 Flash i DeepSeek V4 Flash za uporedni test
Evo ga. Tibo, glavni za Codex, objavio je da Codex, kao i CLI i SDK, izvorno podržava bilo koji open source model, ne samo GPT-5.5.

Ovo je za nas domaće korisnike veliki plus.
To znači da možemo bezbrižno da povežemo Codex sa drugim domaćim modelima, kao što su DeepSeek V4 Flash i Step 3.7 Flash.
Za ovo, moramo dati OpenAI veliki plus.
Znat ćete, Codex i Claude Code su trenutno najbolji Agent alati.
Bez njih dvojice, zaista ne bih mogao da radim ništa.

01. Sloboda modela u Codex-u
Zvanična dokumentacija Codex-a jasno navodi da se Codex može usmeriti na bilo koji model koji podržava Chat Completions ili Responses API.

I naglašava da je podrška za Chat Completions API zastarela i biće uklonjena u budućim verzijama Codex-a.

Ovaj zahtev će eliminisati grupu modela koji još uvek ne podržavaju Responses API, kao što je DeepSeek V4.

Ako želite da Codex podržava DeepSeek V4, potrebno je napraviti intermedijalni proxy za konverziju protokola. Moj open source projekat PaiSwitch to radi.

Naravno, ako model već kompatibilan sa Responses API, možete ga direktno integrisati, kao Step 3.7 Flash, koji je postao prvi ne-OpenAI model koji izvorno podržava Codex.

Postoje dva načina konfiguracije.
Prvi, direktno izmenite konfiguracioni fajl. Konfiguracija Codex-a je u ~/.codex/config.toml, upišite model_providers blok. Pošto Step 3.7 Flash izvorno podržava Responses API, konfiguracija je jednostavna.
model_provider = "stepfun"
model = "step-3.7-flash"
model_reasoning_effort = "high"
[model_providers.stepfun]
name = "StepFun"
base_url = "https://api.stepfun.com/v1"
wire_api = "responses"Drugi, koristite PaiSwitch ili CC-Switch. Ovo prvo je konzola za modele koju sam napravio, nakon odabira modela i unosa API ključa, možete jednim klikom upisati u Codex-ov config.toml i auth.json.

U njoj je ugrađen proxy za protokol, za modele koji podržavaju samo Chat Completions kao DeepSeek, PaiSwitch automatski radi konverziju iz Responses API u Chat Completions.
Naravno, bilo da je CC-Switch ili PaiSwitch, ispod haube zapravo menjaju konfiguracioni fajl, princip je isti.

Kako god bilo, što Codex može da odvoji sloj modela, znači da je odustao od kratkoročne lepljivosti koju donosi zaključavanje modela, u zamenu za veću mogućnost, da postane neutralna platforma koja je odgovorna samo za Agent orkestraciju i saradnju između modela.
Zaista je open.
Nakon što smo rešili domaće modele u Codex-u, hajde da napravimo uporedni test, da vidimo kako se DeepSeek V4 Flash i Step 3.7 Flash ponašaju u tri scenarija: Coding Agent, Search Agent, Tool-use Agent.
02. Poređenje parametara
Prvo da izložimo i uporedimo parametre DeepSeek V4 Flash i Step 3.7 Flash.
| Dimenzija | DeepSeek V4 Flash | Step 3.7 Flash |
|---|---|---|
| Datum izdavanja | 24. april 2026 | 29. maj 2026 |
| Ukupni parametri | 284B | 198B (uključuje 1.8B ViT vizuelni enkoder) |
| Aktivni parametri | 13B | 11B |
| Arhitektura | MoE + CSA/HCA hibridna pažnja | MoE (288 eksperata × top-8) + klizni prozor/globalna hibridna pažnja |
| Kontekstni prozor | 1M tokena | 256K tokena |
| Maksimalni izlaz | 384K tokena | 256K tokena |
| Multimodalnost | Ne | Da (izvorna vizija) |
| Open source licenca | MIT | Apache 2.0 |
Dva modela idu potpuno različitim tehničkim putanjama.
DeepSeek V4 Flash radi agresivnu kompresiju u mehanizmu pažnje. Suština koju zvanično pominje je token-wise compression + DSA (DeepSeek Sparse Attention), koja pri kontekstu od 1M značajno smanjuje računsku i memorijsku potrošnju. 284B ukupnih parametara, 13B aktivnih, koristi FP4 kvantizaciju MoE sloja eksperata, fajl modela je oko 160GB.
Njegova ključna prednost je "isti posao završi sa manje hardverskih resursa".

Step 3.7 Flash je optimizovan za Agent zadatke. Od 198B parametara, ugrađen je ViT vizuelni enkoder od 1.8B parametara, koji izvorno podržava vizuelne ulaze kao što su screenshot-ovi, dizajnerske skice, grafikoni, sposobnost vizuelnog razumevanja direktno ulazi u Agent radni tok, umesto kao zaseban modul.
Od 45 jezičkih slojeva, 42 su rutirani MoE slojevi, svaki sloj bira top-8 od 288 eksperata, uz 3-way Multi-Token Prediction, brzina zaključivanja ide do 400 tokena/s.
DeepSeek V4 Flash podrazumevano ima 1M kontekst, Step 3.7 Flash ima 256K.
03. Ko piše kod brže
Isti prompt poslat oba modela, svaki nezavisno generiše kod, direktno upoređujemo kvalitet rezultata.
Pošto nakon promene modela u Codex-u morate da restartujete da biste učitali novi model, ovde direktno koristim PaiCLI, jedan Claude Code koji sam sam Vibe Coding-om napravio.

Direktno /model prebacivanje jednim klikom, veoma zgodno.
Odabrao sam frontend projekat određene složenosti: u demo-step direktorijumu, replicirajte https://claude.nagdy.me/learn/slash-commands/ sajt, na kineskom, zahtev 1:1 reprodukcija.

Ovaj sajt zahteva raspored u tri kolone (leva navigacija + srednji sadržaj tutorijala + desna imitacija interaktivne demonstracije terminala), uključuje kartice kategorija komandi, workflow šablone, komponente kviza sa izborom, kao i efekat animacije kucanja znak po znak u desnom terminalu. Konačni izlaz je HTML fajl koji se može direktno otvoriti u browseru.

Ovaj zadatak je prilično sveobuhvatan.
Trebalo je pisati HTML strukturu i CSS stilove, ali i JS interakcionu logiku (animacija kucanja, povratne informacije kviza, naglašavanje navigacije), a i vizuelni dizajn je morao biti na mestu (topla bela pozadina, narandžasta glavna boja, zaobljene kartice, monospace oznake komandi).
Performansa DeepSeek V4 Flash



Performansa Step 3.7 Flash



Direktno na uporedne podatke:
| Dimenzija | DeepSeek V4 Flash | Step 3.7 Flash |
|---|---|---|
| End-to-end vreme | oko 38 sekundi | oko 42 sekunde |
| Ukupna potrošnja tokena | oko 15K tokena | oko 22K tokena |
| Broj poziva alata | 12 puta | 14 puta |
| Reprodukcija rasporeda tri kolone | Struktura uglavnom tačna, ali su stilovi desne terminalne zone znatno odstupali | Razmera tri kolone, razmaci i originalni sajt visoko konzistentni |
| Efekat animacije kucanja | Nije implementirana animacija znak po znak | Kompletno reprodukovano kucanje znak po znak + treperenje kursora |
| Reprodukcija boja | Glavna boja značajno odstupa, nedostaju zaobljenosti kartica i senke | Topla bela pozadina, narandžasta glavna boja, zaobljene kartice sve reprodukovano |
| Kompletnost interaktivne logike | Komponenta kviza nedostaje povratna informacija | Kviz sa izborom, naglašavanje navigacije, interakcija kartica kategorija komandi kompletna |
Prema rezultatima, Step 3.7 Flash je u reprodukciji bliži originalnom sajtu. Raspored, boje i animacija su u sve tri dimenzije na nivou reprodukcije blizu 1:1.
Takođe, iz procesa rada PaiCLI-ja se može videti da je Agent tokom izvršenja zadatka pozivao mnogo alata, kao što je StepSearch.

StepSearch je alat za pretragu interneta koji pruža StepFun.
Zatim, na primer, poziv Chrome Devtools MCP, koji se koristi za direktno otvaranje ciljnog sajta kroz Chrome browser.

Obratite pažnju na take_snapshot, koji se može koristiti za izdvajanje strukture i teksta stranice (kao što su accessibility tree, DOM tree i UID), generišući tekst podatke koje je lako razumeti velikim modelima.
Ceo proces uključuje mnogo koraka (pretraga→čitanje→izdvajanje→generisanje itd.), ali je performansa Step 3.7 Flash uvek bila veoma stabilna.
04. Iskustvo multimodalnog radnog toka
Prethodno smo testirali čistu generaciju koda, u ovom odeljku promenimo smer, pogledajmo kako se Step 3.7 Flash ponaša u multimodalnom radnom toku.
Ovde se ne testira samo sposobnost generisanja slika, već sposobnost Agent orkestracije [razumevanje → raspoređivanje → generisanje] celog lanca.
Step 3.7 Flash ima ugrađen ViT vizuelni enkoder od 1.8B parametara, koji može direktno u Agent radnom toku čitati slike, razumeti slike, a zatim na osnovu rezultata razumevanja rasporediti zadatke nizvodno — to DeepSeek V4 Flash trenutno ne može (čisto tekstualni model).
Ovog puta koristimo PaiAgent da pokrenemo, prvo testiramo generisanje slike iz teksta. Prompt je "Azijatkinja sa okruglim naočarima, sedi u kafiću pored prozora, sunce sija kroz staklo na lice, prirodno svetlo, plitka dubinska oštrina, fotorealistično, Fuji Superia 400 tonska boja filma".

Rezultati su prikazani ispod:

Svetlost, ten, odsjaj na naočarima su obrađeni veoma prirodno, gotovo da se ne vidi trag AI generacije.
Sada sledi glavno.
Sliku iz kafića koju smo maloprad generisali koristimo kao ulaz, nateramo Step 3.7 Flash da pročita sliku i generiše sliku za identifikaciju.
Ključ ovog zadatka je: model prvo mora da razume karakteristike likova na originalnoj slici (lice, frizura, stil naočara), zatim izdvoji lik iz složene pozadine, i konačno generiše novu sliku prema specifikacijama za identifikacionu fotografiju.


Rezultat: zamena pozadine je vrlo čista, ivice lika nemaju očigledne neravnine, karakteristike lica su takođe očuvane.
Ceo proces je: tekst u sliku → čitanje slike i razumevanje → generisanje identifikacione fotografije, Step 3.7 Flash prelazi ceo lanac, usput nije potrebno prebacivanje modela ili ručni transfer.
To je prednost ulaska izvorne vizuelne sposobnosti u Agent radni tok.
05. Preporuke za izbor
Za visokofrekventne, jednostavne zadatke asistencije u kodu (kompleti jednostavnih izmena, formatiranje, objašnjenje koda), izaberite DeepSeek V4 Flash.
Trošak je izuzetno nizak, 1M kontekst obradi velike fajlove bez pritiska, sposobnost jednokružnog rezonovanja (GPQA Diamond 88.1%) je dovoljna za ovakve scenarije.
Za kompleksne Agent radne tokove (koji uključuju višekružno rezonovanje, orkestraciju alata, pretragu sinteze, izmene više fajlova), izaberite Step 3.7 Flash.

End-to-end stabilnost je bolja, ušteda na troškovima ponavljanja od prvog prolaza može delimično nadoknaditi razliku u ceni. Izvorna multimodalna sposobnost je dodatni plus, razumevanje screenshot-a → generisanje koda ovakav proces može da odrađuje odjednom, DeepSeek to trenutno ne može.
Za scenarije gde je potrebno integrisati Codex, Step 3.7 Flash ima prednost izvorne podrške za Responses API, direktno povezivanje bez intermedijalnog gateway-a, manja latencija. DeepSeek V4 Flash mora preko PaiSwitch proxy-ja za konverziju protokola, još jedan skok, ali funkcionalno ne trpi.
ending
Zasad, Codex i Claude Code su dva najbolja Agenta, ne samo za kodiranje.
Oba mogu da priključe domaće modele, što je za nas domaće korisnike zaista veoma prijateljski.
Naravno, da bi se postiglo savršeno kombinovanje sa Codex-om, potrebno je da domaći modeli što pre podrže Responses API, i da pozivi tool call budu što konzistentniji.

Zasad, Step 3.7 Flash to radi dobro, među prvim je ne-OpenAI modelima koji izvorno podržavaju Codex, i performanse su stabilne.
[Izbor modela je kao izbor alata. Nije pitanje ko ima najviše parametara, već ko posao završi najbrže.]
