Beeld: AI-gegenereerd
Xiaomi lanceert deze week MiMo-V2.6, met een Pro-model dat bovenaan staat bij open modellen. Het bedrijf koppelt de sprong aan zwaardere training, terwijl Anthropic Xiaomi juist misbruik van Claude verwijt op 22 september 2026.
Het Pro-model scoort volgens meetbureau Artificial Analysis het hoogst onder open modellen en is tegelijk goedkoop per taak. De timing is gevoelig, omdat een dreigingsrapport van Anthropic twee weken eerder zeven Chinese labs noemde in een campagne rond Claude, met Xiaomi erbij.
46 punten en voorop bij open modellen
Volgens Xiaomi haalt MiMo-V2.6-Pro 46 punten op de Intelligence Index van Artificial Analysis. Daarmee staat het boven rivalen als Kimi K3 en Qwen. Pro is een mixture-of-experts model met 1,02 biljoen parameters, waarvan per aanvraag 42 miljard actief zijn. Naast Pro verschijnt de kleinere en zuinigere MiMo-V2.6-Flash.
De prestaties stijgen ook op DeepSWE, een coderingstest. Pro gaat van 58,4 naar 72,6. Flash gaat van 48,8 naar 65,7. Xiaomi levert bovendien Pro-UltraSpeed, een variant met tot 20 keer de uitvoersnelheid.
Kosten per tokens en per taak dalen
De prijs ligt op 0,38 euro per miljoen invoertokens (0.435 dollar) en 0,76 euro per miljoen uitgaatokens (0.87 dollar). Tokens zijn stukjes tekst die het model verwerkt of produceert. Artificial Analysis rekent voor dat één testtaak ongeveer 0,11 euro kost (0.13 dollar). Het model komt zo op de Pareto-frontier van intelligentie en kosten.
Xiaomi schrijft de winst toe aan sterk opgeschaalde reinforcement learning, training via proberen, feedback en beloning. Het bedrijf schroefde drie knoppen open: meer data per trainingsstap, meer variatie in taken en meer rekenkracht voor het beoordelen van oplossingen. De run duurde minder dan zes dagen en kostte ongeveer 2,62 miljoen dollar voor Pro en 0,85 miljoen dollar voor Flash.
Voor stabiliteit op deze schaal bevroor Xiaomi het interne verdeelmechanisme van het model. Het voegde meerdere beschermlagen toe tegen reward hacking, trucs waarmee een model beloningen scoort zonder de taak echt te lossen.
Xiaomi deelt RL-toolkit en trainingspakketten
Opvallend is dat Xiaomi de RL-toolkit openstelt. Het levert een technisch rapport, het volledige trainingsraamwerk, een kleiner model voor verdere training en ongeveer 7.000 kant en klare trainingstaken met automatische beoordelaars. Die taken dekken softwareontwikkeling, cybersecurity, kantoorwerk en webdesign, plus ongeveer 1.000 taken voor muziekcompositie.
De taken komen uit meerdere bronnen. Een deel van de code komt uit echte GitHub pull requests van werknemers en uit gebruikersvragen. Andere taakomschrijvingen zijn gegenereerd door een taalmodel. De cybertaken leunen op OSS-Fuzz, een verzameling van tienduizenden echte softwarelekken. Kantooromgevingen zijn synthetisch nagebouwd.
Anthropic noemt Xiaomi in misbruikrapport
Anthropic onderzocht misbruik van Claude tussen december 2025 en augustus 2026. Het noemde zeven Chinese labs die aan campagnes zijn gelinkt: Alibaba, Moonshot AI, DeepSeek, Zhipu, Xiaomi, MiniMax en SenseTime. In totaal zouden zij ongeveer 190 miljoen interacties hebben gegenereerd om Claude-capaciteiten te kopiëren, een methode die Anthropic illegale distillatie noemt.
Volgens Anthropic volgt Xiaomi in casus GTG-16008 een patroon van meer dan 400.000 interacties over 20 dagen in maart en april 2026. Xiaomi zou gesprekken en codesessies van eigen MiMo-modellen via OpenClaw en OpenCode aan Claude hebben voorgelegd om trainingsdata te verrijken. Het rapport documenteert nauwelijks waar eerdere leerdata voor interne leraarmodellen vandaan kwamen.
Artificial Analysis plaatst MiMo-V2.6-Pro bovenaan de open-modelranglijst met 46 punten.
