• Home
  • /
  • Nieuws
  • /
  • NVIDIA Nemotron 3 staat #1 op Voice Arena: 14,72% DER, acht sprekers

Door Dave

september 23, 2026

Beeld: Unsplash / Nana Dua

De evaluatie gebeurde op Voice Arena en omvatte live en opgenomen gesprekken met overlap.

Toepassingen koppelen zo ‘wat is gezegd’ aan ‘wie sprak wanneer’. Dat verhoogt de bruikbaarheid van zoekfuncties, samenvattingen, actiepunten en gesprekssensoren. Het model ondersteunt tot acht sprekers en levert tijdstempels per sprekerkanaal.

Resultaten op Diarization-Bench

De ranglijst vergelijkt 12 systemen en 17 configuraties over 139 Engelstalige gesprekken met samen ongeveer 22 uur audio. Met overlapscoring, systeem-gegenereerde spraakactiviteit en geen boundary collar noteert Nemotron 3 Diarization 14,72 procent DER. Het volgende systeem scoort 19,3 procent, wat neerkomt op circa 24 procent relatieve verlaging onder deze instellingen.

Het model staat ook eerste met 100 milliseconde en 250 milliseconde collars en in zowel in-person als online opnames. Voice Arena rondt een Version 1-evaluatie af met een gekoppelde statistische analyse. De resultaten kunnen daarna veranderen op basis van die procedure en het vaste protocol.

Acht benchmarks en 41.0 procent gemiddelde daling

Bij 1,04 seconde input-bufferlatentie verlaagt het model de DER op alle acht getoetste condities ten opzichte van de vier-spreker Streaming Sortformer-baseline. De relatieve dalingen lopen uiteen van 9,0 procent op CALLHOME-Part2 tot 65,2 procent op NOTSOFAR1 MHM. Het ongewogen gemiddelde van die acht relatieve dalingen bedraagt 41.0 procent.

Een nuance staat in de cijfers voor CALLHOME. In de twee-sprekersubset noteert het nieuwe model 5,98 procent DER tegen 5,68 procent voor de baseline. Over de volledige CALLHOME-Part2-set verbetert het juist van 10,32 procent naar 9,10 procent. DIHARD III bundelt vijf tot en met negen sprekers, wat op negen sprekers boven het maximum van acht uitkomt.

Latency, throughput en modeldetails

De aanbevolen input-buffers zijn 30,4 seconde, 1,04 seconde, 0,64 seconde en 0,32 seconde. Deze waarden meten de audio die vóór inferentie wordt gebufferd. De configuratie met 0,32 seconde is de laagste aanbevolen instelling. Een buffer van 80 milliseconde is technisch mogelijk, maar valt buiten de aanbeveling voor gebruik.

Throughput wordt gemeten als real-time factor speedup, dus audiotijd gedeeld door verwerkingstijd. Op een NVIDIA RTX PRO 5000 met BF16 en torch.compile() haalt het model 15.113× bij 30,4 seconde en batchgrootte 32, tegen 2.619× voor de baseline. Tegelijk daalt DIHARD III DER van 19,09 procent naar 12,73 procent. Bij 1,04 seconde zijn de waarden 865× tegenover 136×, met DER omlaag van 19,60 procent naar 13,18 procent.

Het model verwerkt 16 kHz enkelkanaals audio en zet die om in Mel-spectrogramkenmerken met stappen van 10 milliseconde. De features worden met factor acht gestapeld tot frames van 80 milliseconde voor een 31-laags Transformer met RoPE. De standaarduitvoer is een [T, 8] tensor met per tijdstap een kans op sprekersactiviteit per kanaal.

De ordening van sprekers volgt de volgorde van binnenkomst. De eerste nieuwe stem wordt kanaal één, de volgende kanaal twee, enzovoort. Dat houdt de generieke labels stabiel in streaming. De streamingparameters staan in 80 milliseconde encoderframes. Het model ondersteunt 16 kHz, enkelkanaals .wav, .flac, .opus en .mp3 op Linux met NVIDIA Ampere-, Hopper- of Blackwell-GPU’s.

Training, integratie en beperkingen

De training gebruikte publieke en gelicentieerde data, waaronder meersprekergesprekken van David AI. Gelicentieerde audio van David AI leverde bronmateriaal voor grootschalige gesimuleerde Engelse en meertalige mixen in 21 talen. Het toevoegen van David AI-data verlaagde de samengestelde DER met 0,77 procentpunt, van 11,19 procent naar 10,42 procent, bij offline- en ultra-low-latency-instellingen.

Argmax voegde ondersteuning toe in Argmax Pro SDK 3 en introduceerde een pre-diarized transcription API die sprekers scheidt vóór spraakherkenning. Dat helpt bij complexe gesprekken met overlap. Prestaties kunnen dalen bij lange opnames, zware ruis, nagalm, far-field, domeinverschuiving of meer dan acht sprekers. Toepassingen horen de volledige pijplijn te toetsen op het beoogde audiodomein.

Een benchmark is hier een vaste evaluatie met een openbaar protocol en bekende instellingen. Latency is de bufferduur vóór inferentie. Throughput is verwerkte audio per rekentijd. Parameters zijn instelwaarden voor streaming, uitgedrukt in frames van 80 milliseconde. Deze definities sluiten aan bij de genoemde meetmethode en configuratie.

Bron: Hugging Face (huggingface.co)
https://huggingface.co/blog/nvidia/nemotron-diarization

Over de schrijver 

Dave

Hoi, ik ben Dave – schrijver, onderzoeker en nieuwsgierige geest achter AIInsiders.nl. Ik hou me bezig met de manier waarop technologie ons leven verandert, en vooral: hoe we dat een beetje kunnen bijbenen. Van slimme tools tot digitale trends, ik duik graag in de wereld achter de schermen.

Mijn stijl? Lekker helder, soms kritisch, altijd eerlijk. Geen onnodig jargon of overdreven hype, maar praktische inzichten waar je echt iets aan hebt. AI is niet eng of magisch – het is interessant, en ik help je graag om dat te zien.

Meer lezen

23/09/2026 14:48

Beeld: AI-gegenereerd Prosus kondigde gisteren een nieuw leiderschapsteam voor AI, tech en product aan. Het aan de AEX genoteerde bedrijf benoemde Ronald Hans tot chief lees verder

Prosus benoemt Ronald Hans tot chief product officer: Toqan naar klanten

23/09/2026 12:33

Beeld: AI-gegenereerd Daniel Roher en Charlie Tyrell onderzoeken in The AI Doc: Or How I Became an Apocaloptimist of AI hoop of gevaar brengt. De lees verder

The AI Doc op Netflix: Altman, Amodei en Hassabis over AI-race

23/09/2026 10:33

Beeld: AI-gegenereerd Arnoud Engelfriet, ict-jurist bij ICTRecht, schetst wanneer winkels AI-gebruik bij camera’s moeten melden. De transparantieplicht uit de AI Act geldt niet voor shoppers lees verder

AI Act laat winkels AI‑camera’s ongemeld: AVG kan bordje eisen

23/09/2026 08:19

Beeld: AI-gegenereerd De Griekse premier Kyriakos Mitsotakis sprak in San Francisco voor ongeveer 250 founders, investeerders en operators. Hij pitchte Griekenland aan techbedrijven en was lees verder

Mitsotakis pitcht Griekenland: groot deel van €36 miljard naar digitalisering
>