Metaphrase

Zelf gehoste spraak-AI

De tolk die altijd aan de balie staat.

Metaphrase vertaalt gesproken taal live tussen Nederlands en achttien andere talen. Het draait op uw eigen hardware, met een model dat wij zelf hebben getraind. Geen externe API, geen opname die uw netwerk verlaat.

nl
uk

metaphrase-onix

eigen model, lokaal geladen

6,34%

woordfoutmarge op Nederlands

25x

sneller dan realtime

18

talen aan de bezoekerskant

0

externe API-aanroepen

Live tolkconsole

Twee sprekers, twee talen, één sessie.

Hieronder loopt een sessie mee zoals de engine hem verwerkt. Links de baliemedewerker, rechts de bezoeker. Elke beurt verschijnt eerst als voorlopige tekst en wordt daarna vastgezet met een vertaling en gesproken uitvoer.

Verbinden

Balie

Nederlands

Bezoeker

Oekraïens

Balienlvastgezetlatency 0,38 s
Goedemiddag, waarmee kan ik u helpen?
vertalinguk

Доброго дня, чим я можу вам допомогти?

Samenvatting bij afsluiten

nl

Bezoeker wil zich inschrijven op een nieuw adres. Paspoort is aanwezig, het huurcontract staat op de telefoon en wordt aan de balie gescand. De inschrijving is aangemaakt.

uk

Відвідувач хоче зареєструватися за новою адресою. Паспорт при собі, договір оренди в телефоні та буде відсканований на стійці. Реєстрацію оформлено.

Hoor het zelf

Tik op de bol en luister mee.

Kies een taal en tik op de bol. U hoort eerst de Nederlandse zin zoals de balie hem uitspreekt, daarna de vertaling zoals de bezoeker hem hoort. Dit voorbeeld gebruikt de spraaksynthese van uw browser, in de pilot is dat de gekloonde stem uit de sessie zelf.

Klaar om af te spelen

Balienl

Goedemiddag, waarmee kan ik u helpen?

Bezoekeren

Good afternoon, how can I help you?

Taal van de bezoeker

Tik op de bol

Signaalketen

Van microfoon tot gesproken vertaling, in één proces.

Alles gebeurt binnen één server op uw eigen GPU. Er staat geen wachtrij naar een cloudprovider tussen, en geen tussenpartij die meeluistert.

  1. Opname

    16 kHz PCM

    Zestien kilohertz PCM komt binnen over WebSocket. Stereo wanneer u twee microfoons gebruikt, mono wanneer er één microfoon op de balie ligt.

  2. Sprekerscheiding

    stereo of stemafdruk

    Bij stereo scheidt het kanaal de sprekers. Bij mono bepaalt een stemafdruk wie er spreekt, zodat de rollen niet omdraaien.

  3. Transcriptie

    metaphrase-onix

    metaphrase-onix zet spraak om in tekst. Voorlopige tekst verschijnt terwijl iemand nog praat, definitieve tekst zodra de zin af is.

  4. Vertaling

    in-process LLM

    Een taalmodel in hetzelfde proces vertaalt de vastgezette zin naar de taal van de ander, in formeel register.

  5. Stem

    XTTS v2

    De vertaling wordt uitgesproken. Desgewenst in de stem van de spreker zelf, gekloond uit een paar seconden referentie uit de sessie.

metaphrase-onix

Ons eigen model, getraind op Nederlands.

Whisper large v3 turbo verstaat Nederlands redelijk. Wij hebben het bijgetraind met een LoRA op Nederlandse spraak, samengevoegd en geëxporteerd naar GGML zodat de engine het rechtstreeks laadt. Dezelfde snelheid, minder fouten.

Woordfoutmarge op Nederlands

Dezelfde tweehonderd fragmenten uit Common Voice, identieke decodering.

22% minder fouten

whisper-large-v3-turbobasismodel

8,14%

metaphrase-onixons model

6,34%

0%2,5%5%7,5%10%

Dit komt uit een proefronde van drieduizend fragmenten en vijfhonderd trainingsstappen. Meer data en meer stappen brengen het verder omlaag.

Alles over het model

0,44 s

Elf seconden audio

Warme aanvraag op een RTX 4070. Dat is ongeveer vijfentwintig keer sneller dan realtime, dus de vertaling loopt achter de spreker aan in plaats van andersom.

C++20

Engine op GGML

Eén binary met een CUDA-backend, gebouwd op whisper.cpp. Geen Python in het hete pad, geen frameworklaag die geheugen opsnoept.

EN + NL

Twee richtingen

Transcriptie in Nederlands en Engels, plus vertaling van Nederlands naar Engels in het model zelf. De overige talen lopen via het taalmodel ernaast.

Opstelling

Twee manieren om een balie in te richten.

De sessie is in beide gevallen dezelfde. Het verschil zit in hoe de engine bepaalt wie er spreekt.

Stereo

Twee microfoons, twee kanalen

Links de balie, rechts de bezoeker. De scheiding zit in de hardware, dus er valt niets te verwarren, ook niet wanneer mensen door elkaar praten. Dit is de meest betrouwbare opstelling en de eerste keuze voor een vaste werkplek.

  • Geen verwarring bij overlap
  • Geen inspreken vooraf
  • Vaste rollen per kanaal
Mono

Eén microfoon en een stemafdruk

De medewerker spreekt eenmalig een korte referentie in. Die stemafdruk hoort bij het account, dus de engine herkent aan de stem wie er spreekt. Herkent hij de stem niet, dan valt hij terug op taalherkenning.

  • Werkt met bestaande apparatuur
  • Voiceprint per medewerker
  • Terugval op taalherkenning

Toepassingen

Gebouwd voor gesprekken die niet kunnen wachten op een tolk.

Overal waar iemand aan een loket, in een spreekkamer of in een verhoorkamer iets moet begrijpen wat vandaag geregeld wordt.

Gemeenteloket

Inschrijvingen, aanvragen en vragen over post die de bezoeker niet kan lezen. De balie blijft Nederlands spreken, de bezoeker blijft de eigen taal spreken, en het gesprek loopt door zonder dat er een tolk ingepland hoeft te worden.

Geen wachttijd op een tolkdienst

Justitie en politie

Intakes, aangiftes en gesprekken op locatie waar wachten op een tolk uren kost. Audio en transcript blijven binnen uw eigen infrastructuur, wat bij vertrouwelijke zaken vaak de enige werkbare optie is.

Alles binnen eigen infrastructuur

Zorg en intake

Anamnese en intakegesprekken waarin een misverstand direct gevolgen heeft. De vertaling houdt formeel register aan en de tweetalige samenvatting kan mee in het dossier.

Tweetalige samenvatting per gesprek

Onderwijs

Oudergesprekken, aanmeldingen en zorgoverleg. Ouders die geen Nederlands spreken volgen het gesprek in hun eigen taal en krijgen achteraf dezelfde samenvatting als de school.

Ouders volgen live mee

Klantcontact

Receptie, servicebalie en supportlijnen met internationaal publiek. Eén sessie per gesprek, meetbare latency, en logging die u zelf inricht in plaats van een dashboard bij een leverancier.

Meetbare latency per sessie

Hoorzittingen

Bezwaarcommissies, hoorzittingen en overleg met meerdere sprekers. Iedereen houdt de eigen taal aan en het verslag komt tweetalig uit de sessie rollen.

Verslag in twee talen

Zelf gehost

Uw gesprekken blijven op uw eigen hardware.

Dit is geen belofte in een verwerkersovereenkomst maar een eigenschap van de architectuur. Er is simpelweg geen uitgaande verbinding waar audio doorheen kan.

Geen externe API

De engine, het taalmodel en de spraaksynthese draaien in dezelfde container op uw GPU. Er gaat geen audio en geen tekst naar een derde partij.

AVG zit in de opzet

Omdat er niets verstuurd wordt, is er geen doorgifte buiten de EU om te verantwoorden en geen Amerikaanse verwerker in de keten.

U bepaalt de bewaartermijn

Audio staat alleen in het geheugen zolang de sessie loopt. Wat u bewaart, hoe lang en waar, stelt u in uw eigen omgeving in.

Draait waar u wilt

Een Linux-container met een NVIDIA-GPU. In uw eigen rack, in een private cloud, of op een GPU-pod die u zelf huurt.

Ontwikkelaars

Eén server, twee manieren om hem te gebruiken.

Realtime over WebSocket voor gesprekken, asynchroon over REST voor bestanden. Beide zitten in dezelfde binary en delen hetzelfde geladen model.

const ws = new WebSocket("wss://tolk.intern/v1/interpret?other=uk"); ws.onmessage = (event) => {  const msg = JSON.parse(event.data);   if (msg.type === "partial") {    render(msg.speaker, msg.src_text, { committed: false });  }   if (msg.type === "final") {    render(msg.speaker, msg.src_text, { committed: true });    speak(msg.tgt_lang, msg.tgt_text);  }}; // Interleaved stereo 16 kHz int16 PCM. L = desk, R = visitor.mic.ondata = (pcm) => ws.send(pcm);

Voorbeeld uit de test client die met het project meekomt.

  • WS/v1/interpretTwee sprekers live tolken. Stereo of mono, met vertaling en gesproken uitvoer.
  • WS/v1/streamRealtime transcriptie van één spreker, met voorlopige en definitieve tekst.
  • POST/v1/transcriptionsEen WAV transcriberen of vertalen. Taal automatisch of vastgezet.
  • POST/v1/detect-languageTaal bepalen uit een kort fragment, als bevestigingsstap voor de sessie.
  • POST/v1/summaryTweetalige samenvatting van een transcript of van de segmenten uit een sessie.
  • POST/v1/voice/enrollStemafdruk aanmaken uit een korte opname, voor sprekerherkenning in mono.
  • GET/v1/languagesDe talenlijst die de bezoekerskiezer vult.
  • GET/healthzHealth- en readinessprobe voor uw orkestratie.

Talen

Achttien talen aan de bezoekerskant.

Nederlands staat vast aan de baliekant. De bezoeker kiest een taal of de engine bepaalt hem uit het eerste fragment. Het model herkent er meer, dit is de lijst die standaard in de kiezer staat.

nlNederlands
enEngelsEnglish
frFransFrançais
deDuitsDeutsch
esSpaansEspañol
itItaliaansItaliano
ptPortugeesPortuguês
plPoolsPolski
roRoemeensRomână
trTurksTürkçe
arArabischالعربية
faPerzischفارسی
ruRussischРусский
ukOekraïensУкраїнська
soSomalischSoomaali
tiTigrinyaትግርኛ
zhChinees中文
hiHindiहिन्दी

Vragen

Wat mensen ons vragen voor een pilot.

Ja. Na installatie heeft de engine geen uitgaande verbinding nodig. De modellen staan lokaal, ook die voor vertaling en spraaksynthese.

Een NVIDIA-GPU met voldoende geheugen. Op een RTX 4070 verwerkt de engine elf seconden audio in ongeveer 0,44 seconde. Voor meer gelijktijdige sessies schaalt u met geheugen en kaarten.

Op tweehonderd fragmenten uit Common Voice haalt metaphrase-onix 6,34 procent woordfoutmarge, tegenover 8,14 procent voor het basismodel bij identieke decodering. Dat is tweeëntwintig procent minder fouten.

Ja. De spraaksynthese kloont de stem uit een paar seconden referentie uit de sessie zelf. U kunt ook een vaste studio-stem instellen wanneer dat prettiger is aan een publieke balie.

In stereo scheidt de hardware de sprekers, dus overlap levert geen probleem op. In mono bepaalt de stemafdruk wie er spreekt en wordt de beurt vastgezet zodra iemand uitgesproken is.

Ja. Het model is van ons, dus we kunnen bijtrainen op uw eigen opnames en terminologie. De pipeline die metaphrase-onix produceert hoort bij het project.

Pilot

Zet hem twee weken op één balie.

We installeren de engine op uw eigen hardware of op een GPU-pod die wij voor de pilot regelen, met uw talen en uw stemafdrukken. Na twee weken heeft u cijfers over doorlooptijd, tolkkosten en wat medewerkers ervan vinden.

  • Installatie in één werkdag
  • Uw eigen talen en stemafdrukken
  • Meetbare cijfers na twee weken