0,44 s
Elf seconden audio
Warme aanvraag op een RTX 4070. Dat is ongeveer vijfentwintig keer sneller dan realtime, dus de vertaling loopt achter de spreker aan in plaats van andersom.
Zelf gehoste spraak-AI
Metaphrase vertaalt gesproken taal live tussen Nederlands en achttien andere talen. Het draait op uw eigen hardware, met een model dat wij zelf hebben getraind. Geen externe API, geen opname die uw netwerk verlaat.
metaphrase-onix
eigen model, lokaal geladen
6,34%
woordfoutmarge op Nederlands
25x
sneller dan realtime
18
talen aan de bezoekerskant
0
externe API-aanroepen
Live tolkconsole
Hieronder loopt een sessie mee zoals de engine hem verwerkt. Links de baliemedewerker, rechts de bezoeker. Elke beurt verschijnt eerst als voorlopige tekst en wordt daarna vastgezet met een vertaling en gesproken uitvoer.
Balie
Nederlands
Bezoeker
Oekraïens
Доброго дня, чим я можу вам допомогти?
Samenvatting bij afsluiten
nl
Bezoeker wil zich inschrijven op een nieuw adres. Paspoort is aanwezig, het huurcontract staat op de telefoon en wordt aan de balie gescand. De inschrijving is aangemaakt.
uk
Відвідувач хоче зареєструватися за новою адресою. Паспорт при собі, договір оренди в телефоні та буде відсканований на стійці. Реєстрацію оформлено.
Hoor het zelf
Kies een taal en tik op de bol. U hoort eerst de Nederlandse zin zoals de balie hem uitspreekt, daarna de vertaling zoals de bezoeker hem hoort. Dit voorbeeld gebruikt de spraaksynthese van uw browser, in de pilot is dat de gekloonde stem uit de sessie zelf.
Balienl
Goedemiddag, waarmee kan ik u helpen?
Bezoekeren
Good afternoon, how can I help you?
Taal van de bezoeker
Signaalketen
Alles gebeurt binnen één server op uw eigen GPU. Er staat geen wachtrij naar een cloudprovider tussen, en geen tussenpartij die meeluistert.
16 kHz PCM
Zestien kilohertz PCM komt binnen over WebSocket. Stereo wanneer u twee microfoons gebruikt, mono wanneer er één microfoon op de balie ligt.
stereo of stemafdruk
Bij stereo scheidt het kanaal de sprekers. Bij mono bepaalt een stemafdruk wie er spreekt, zodat de rollen niet omdraaien.
metaphrase-onix
metaphrase-onix zet spraak om in tekst. Voorlopige tekst verschijnt terwijl iemand nog praat, definitieve tekst zodra de zin af is.
in-process LLM
Een taalmodel in hetzelfde proces vertaalt de vastgezette zin naar de taal van de ander, in formeel register.
XTTS v2
De vertaling wordt uitgesproken. Desgewenst in de stem van de spreker zelf, gekloond uit een paar seconden referentie uit de sessie.
metaphrase-onix
Whisper large v3 turbo verstaat Nederlands redelijk. Wij hebben het bijgetraind met een LoRA op Nederlandse spraak, samengevoegd en geëxporteerd naar GGML zodat de engine het rechtstreeks laadt. Dezelfde snelheid, minder fouten.
Dezelfde tweehonderd fragmenten uit Common Voice, identieke decodering.
whisper-large-v3-turbobasismodel
8,14%
metaphrase-onixons model
6,34%
Dit komt uit een proefronde van drieduizend fragmenten en vijfhonderd trainingsstappen. Meer data en meer stappen brengen het verder omlaag.
0,44 s
Warme aanvraag op een RTX 4070. Dat is ongeveer vijfentwintig keer sneller dan realtime, dus de vertaling loopt achter de spreker aan in plaats van andersom.
C++20
Eén binary met een CUDA-backend, gebouwd op whisper.cpp. Geen Python in het hete pad, geen frameworklaag die geheugen opsnoept.
EN + NL
Transcriptie in Nederlands en Engels, plus vertaling van Nederlands naar Engels in het model zelf. De overige talen lopen via het taalmodel ernaast.
Opstelling
De sessie is in beide gevallen dezelfde. Het verschil zit in hoe de engine bepaalt wie er spreekt.
Links de balie, rechts de bezoeker. De scheiding zit in de hardware, dus er valt niets te verwarren, ook niet wanneer mensen door elkaar praten. Dit is de meest betrouwbare opstelling en de eerste keuze voor een vaste werkplek.
De medewerker spreekt eenmalig een korte referentie in. Die stemafdruk hoort bij het account, dus de engine herkent aan de stem wie er spreekt. Herkent hij de stem niet, dan valt hij terug op taalherkenning.
Toepassingen
Overal waar iemand aan een loket, in een spreekkamer of in een verhoorkamer iets moet begrijpen wat vandaag geregeld wordt.
Inschrijvingen, aanvragen en vragen over post die de bezoeker niet kan lezen. De balie blijft Nederlands spreken, de bezoeker blijft de eigen taal spreken, en het gesprek loopt door zonder dat er een tolk ingepland hoeft te worden.
Geen wachttijd op een tolkdienst
Intakes, aangiftes en gesprekken op locatie waar wachten op een tolk uren kost. Audio en transcript blijven binnen uw eigen infrastructuur, wat bij vertrouwelijke zaken vaak de enige werkbare optie is.
Alles binnen eigen infrastructuur
Anamnese en intakegesprekken waarin een misverstand direct gevolgen heeft. De vertaling houdt formeel register aan en de tweetalige samenvatting kan mee in het dossier.
Tweetalige samenvatting per gesprek
Oudergesprekken, aanmeldingen en zorgoverleg. Ouders die geen Nederlands spreken volgen het gesprek in hun eigen taal en krijgen achteraf dezelfde samenvatting als de school.
Ouders volgen live mee
Receptie, servicebalie en supportlijnen met internationaal publiek. Eén sessie per gesprek, meetbare latency, en logging die u zelf inricht in plaats van een dashboard bij een leverancier.
Meetbare latency per sessie
Bezwaarcommissies, hoorzittingen en overleg met meerdere sprekers. Iedereen houdt de eigen taal aan en het verslag komt tweetalig uit de sessie rollen.
Verslag in twee talen
Zelf gehost
Dit is geen belofte in een verwerkersovereenkomst maar een eigenschap van de architectuur. Er is simpelweg geen uitgaande verbinding waar audio doorheen kan.
De engine, het taalmodel en de spraaksynthese draaien in dezelfde container op uw GPU. Er gaat geen audio en geen tekst naar een derde partij.
Omdat er niets verstuurd wordt, is er geen doorgifte buiten de EU om te verantwoorden en geen Amerikaanse verwerker in de keten.
Audio staat alleen in het geheugen zolang de sessie loopt. Wat u bewaart, hoe lang en waar, stelt u in uw eigen omgeving in.
Een Linux-container met een NVIDIA-GPU. In uw eigen rack, in een private cloud, of op een GPU-pod die u zelf huurt.
Ontwikkelaars
Realtime over WebSocket voor gesprekken, asynchroon over REST voor bestanden. Beide zitten in dezelfde binary en delen hetzelfde geladen model.
const ws = new WebSocket("wss://tolk.intern/v1/interpret?other=uk"); ws.onmessage = (event) => { const msg = JSON.parse(event.data); if (msg.type === "partial") { render(msg.speaker, msg.src_text, { committed: false }); } if (msg.type === "final") { render(msg.speaker, msg.src_text, { committed: true }); speak(msg.tgt_lang, msg.tgt_text); }}; // Interleaved stereo 16 kHz int16 PCM. L = desk, R = visitor.mic.ondata = (pcm) => ws.send(pcm);Voorbeeld uit de test client die met het project meekomt.
Talen
Nederlands staat vast aan de baliekant. De bezoeker kiest een taal of de engine bepaalt hem uit het eerste fragment. Het model herkent er meer, dit is de lijst die standaard in de kiezer staat.
Vragen
Ja. Na installatie heeft de engine geen uitgaande verbinding nodig. De modellen staan lokaal, ook die voor vertaling en spraaksynthese.
Een NVIDIA-GPU met voldoende geheugen. Op een RTX 4070 verwerkt de engine elf seconden audio in ongeveer 0,44 seconde. Voor meer gelijktijdige sessies schaalt u met geheugen en kaarten.
Op tweehonderd fragmenten uit Common Voice haalt metaphrase-onix 6,34 procent woordfoutmarge, tegenover 8,14 procent voor het basismodel bij identieke decodering. Dat is tweeëntwintig procent minder fouten.
Ja. De spraaksynthese kloont de stem uit een paar seconden referentie uit de sessie zelf. U kunt ook een vaste studio-stem instellen wanneer dat prettiger is aan een publieke balie.
In stereo scheidt de hardware de sprekers, dus overlap levert geen probleem op. In mono bepaalt de stemafdruk wie er spreekt en wordt de beurt vastgezet zodra iemand uitgesproken is.
Ja. Het model is van ons, dus we kunnen bijtrainen op uw eigen opnames en terminologie. De pipeline die metaphrase-onix produceert hoort bij het project.
Pilot
We installeren de engine op uw eigen hardware of op een GPU-pod die wij voor de pilot regelen, met uw talen en uw stemafdrukken. Na twee weken heeft u cijfers over doorlooptijd, tolkkosten en wat medewerkers ervan vinden.