Top-code voor een tiende van de prijs: wat GLM-5.3 écht laat zien (en wat niet)
Het Chinese lab zet dezelfde basis om in record-scores met pure post-training. Onafhankelijke checks blijven dun: waarom u dat voorzichtig moet lezen.
Geschreven door AI · gecontroleerd door mensen
Bron: z.ai/blog/glm-5.3 · gelezen door de redactie
Het is journalistiek curios: een model-release zonder speculatie rondom geheime architectuur of reuzengrote parametercounts. GLM-5.3 gebruikt volgens Z.ai dezelfde basis als zijn voorganger (743 miljard parameters, waarvan ~40 miljard actief per token) en alle winst komt uit post-training.

Twee modellen, twee verhalen
Op publieke benchmarks claimt Z.ai open-source state-of-the-art, maar alleen op toetsen die het bedrijf zelf afneemt. Terminal-Bench 3.0 springt van 4,6 naar 28,3; Agents' Last Exam (CLI) van 23,8 naar 28,5; DeepSWE v1.1 van 46,2 naar 66,9; AutomationBench van 26,2 naar 48,2.
GLM-5.3-Flash is een ander verhaal. Het model draaide ongeveer een week anoniem als 'ox-alpha' op OpenCode en OpenRouter en was volgens OfficeChai het meest besproken model van die week, voordat Z.ai de naam bevestigde.
Anders dan GLM-5.3 is dit een nieuw getraind basis-model: 320 miljard parameters totaal, slechts 18 miljard actief, met hybride attention en een pre-training-corpus van 30 biljoen tokens. De prijs ligt rond een tiende van het grote broertje.


Wat de benchmarks écht betekenen
Terminal-Bench 3.0 vraagt of een model een kapotte computeromgeving zelfstandig kan repareren — pas geslaagd als alle tests weer groen zijn. Versie 3.0 is véél zwaarder dan zijn voorganger, dáárom liggen álle scores laag, ook die van de duurste concurrenten (Fable 5: 33,7; GPT-5.6 Sol: 34,6). De sprong van 4,6 naar 28,3 is relatief enorm, absoluut nog geen koppositie.
DeepSWE v1.1 meet of een model wekenlang aan één project kan werken zonder de draad te verliezen — denk aan 'voeg een betaalmethode toe in deze bestaande webshop', inclusief database, backend én honderden tests die blijven slagen. Dit komt dagelijks programmeerwerk het dichtst bij; daar steeg GLM-5.3 van 46,2 naar 66,9.
Z.ai Code Bench is het examen van de school zelf: meet taak-afronding én token-verbruik, en tokens zijn geld. Volgens Z.ai haalt GLM-5.3 op max-effort 34,5 procent bij ~75K output-tokens per klus; op high-effort passeert het Claude Opus 4.8 (31,4 vs 29,5 procent) met nog geen helft aan tokens. Twee loodgieters, dezelfde klus — één rekent minder uur.
GDPval-AA v2 is wél onafhankelijk (Artificial Analysis): kenniswerk over 44 beroepen, beoordeeld met Elo zoals bij schaken. GLM-5.3: 1769, ruim omhoog vanaf 1508. En op KingBench 3, de vaste takenlijst van één onderzoeker, is GLM-5.3 met 91,25 procent het beste model ooit op die test — boven Claude Fable 5.

Volledig artikel lezen — inclusief bronnen en reactiemogelijkheid →



