Een uur vergadering laten uitschrijven kost sinds deze week ongeveer dertig cent. Google zette op 26 augustus Gemini 3.5 Transcribe live, een spraakmodel dat je “uh” en “uhm” weglaat, je zelfcorrecties opruimt en bedragen en datums meteen netjes neerzet. Nederlands hoort bij de talen die Google zelf heeft gemeten. Maar de makkelijkste route, dicteren vanuit je Mac, spreekt voorlopig alleen Engels. En één instelling bepaalt of je terugkrijgt wat je letterlijk zei, of een opgepoetste versie van wat je ongeveer bedoelde.
Gemini 3.5 Transcribe is het nieuwe spraak-naar-tekstmodel van Google, beschikbaar sinds 26 augustus 2026. Het schrijft opnames en live gesprekken uit in ruim 85 talen, waaronder Nederlands, haalt stopwoorden weg en kost ongeveer 30 dollarcent per uur audio. Gratis uitproberen kan in Google AI Studio, alleen niet met een echt klantgesprek.
Wat doet Gemini 3.5 Transcribe anders dan gewone spraakherkenning?
Het model levert geen ruwe woordenbrij maar tekst die al is opgemaakt: stopwoorden eruit, zelfcorrecties verwerkt, getallen en bedragen in de juiste notatie. Zeg je “we spreken af op dinsdag, nee, woensdag”, dan staat er alleen nog woensdag in je transcript.
Denk aan het verschil tussen een stenograaf en een notulist. De stenograaf schrijft elk woord op dat valt, inclusief geschuifel en halve zinnen. De notulist levert een leesbaar verslag. Klassieke spraakherkenning is die stenograaf, Gemini 3.5 Transcribe probeert die notulist te zijn.
Google schrijft het in de aankondiging zo op (vertaald uit het Engels):
“Waar gewone spraakherkenning worstelt met achtergrondgeluid, vakjargon en het opruimen van haperingen, zet Gemini 3.5 Transcribe ruwe audio direct om in nauwkeurige, opgemaakte tekst.”
Diego Melendo Casado en Luke Leonhard, Google, 26 augustus 2026
Technisch zijn het twee modellen. gemini-3.5-transcribe is voor opgenomen audio en verwerkt tot een uur geluid per verzoek. gemini-3.5-transcribe-live streamt mee terwijl er gepraat wordt, in sessies van maximaal tien minuten. Allebei vervangen ze Chirp 3, het spraakmodel dat Google tot nu toe aanbood. De tijd tot een definitief transcript ligt volgens Google 70 procent lager dan bij Chirp 3.
Hoe goed is het in het Nederlands?
Nederlands (nl-NL) zit in de set talen waarop Google het model heeft gemeten, maar een apart Nederlands foutpercentage publiceert Google niet. In de voetnoot onder Googles eigen grafieken staat nl-NL netjes tussen de 24 geteste taalvarianten, naast Duits, Frans en Spaans.

Op die benchmark zit de live-variant op 5,50 procent woordfouten. Chirp 3 komt uit op 7,32 procent, ElevenLabs Scribe v2 Realtime op 9,70 procent, OpenAI GPT Live Transcribe op 8,97 procent en Deepgram Nova-3 op 15,77 procent. Voor opgenomen audio scoort Gemini 5,04 procent tegenover 5,66 procent voor Chirp 3. Over alle testsets samen claimt Google een gemiddelde van 4,0 procent live en 2,6 procent bij opnames.
Even voor de beeldvorming: 5 procent woordfouten betekent dat er in een zin van twintig woorden ongeveer één woord niet klopt. Dat is prima voor een verslag en niet goed genoeg voor een letterlijk citaat.
Die cijfers zijn bovendien gemiddelden over tientallen talen, gemeten op voorgelezen zinnen. Jouw praktijk is een klantgesprek met achtergrondgeluid, een Twentse of Limburgse tongval en productnamen die in geen enkel woordenboek staan. Meet het dus zelf, met een opname van vijf minuten die lijkt op je echte werk.
Zo schrijf je je eerste opname uit
De snelste route loopt via Google AI Studio: model kiezen, audiobestand erin, uitvoeren. Je hebt geen creditcard en geen code nodig.
- Ga naar aistudio.google.com en log in met je Google-account.
- Kies als model gemini-3.5-transcribe. Dat is de variant voor bestaande opnames; de live-variant heb je alleen nodig als je tijdens het gesprek wilt meelezen.
- Upload je audiobestand (mp3, wav of m4a). Reken op maximaal een uur audio per verzoek, en op maximaal een half uur zodra je sprekerherkenning of tijdstempels per woord aanzet.
- Zet de taal expliciet op nl-NL als je weet dat het gesprek Nederlands is. Volgens de documentatie van Google is dat nauwkeuriger dan het model zelf laten raden, en houdt het model zich beter aan je eigen woordenlijst.
- Lees het resultaat na op drie plekken: namen van personen, namen van bedrijven en bedragen. Daar gaat het mis, niet in de gewone zinnen.
Eén waarschuwing voordat je een klantgesprek uploadt. In de gratis variant gebruikt Google je invoer om zijn producten te verbeteren, en kunnen menselijke beoordelaars je bestanden inzien. In de eigen API-voorwaarden staat het onomwonden: dien geen gevoelige, vertrouwelijke of persoonlijke informatie in bij de gratis diensten. Alleen bij de betaalde variant belooft Google dat je bestanden niet worden gebruikt om modellen te verbeteren, en dat ze alleen kort bewaard blijven om misbruik op te sporen.
Test dus met een oefenopname waarin je zelf vijf minuten praat over een verzonnen order. Niet met het gesprek van gisteren met je grootste klant.
Smart of verbatim: welke modus kies je?
Verbatim is de standaard in de API en schrijft letterlijk op wat er gezegd is; de smart-modus ruimt op, en kan daarbij betekenis weglaten. Dat verschil is groter dan het klinkt.
Een gebruiker die het model op een Pixel-telefoon testte, meldde in de discussie op Hacker News een treffend voorbeeld. Hij zei iets in de trant van “ik twijfelde of ik het zou nakijken, ik had het moeten verifiëren”, en kreeg terug: “ik had het moeten verifiëren”. De eerste helft was weggepoetst, terwijl hij die er juist bij zei om duidelijk te maken dat hij er eerder over had nagedacht. Hij bleek in de smart-modus te zitten zonder dat te weten.
Er zit ook een harde technische grens aan. Volgens de transcriptie-documentatie is de smart-modus niet te combineren met tijdstempels per woord of met sprekerherkenning. Wil je weten wie wat zei en wanneer, dan val je automatisch terug op verbatim.
Vuistregel: notulen, spraakmemo’s en ingesproken concepten in smart, alles wat later als citaat of bewijs dient in verbatim. Kies dus per klus, niet per gewoonte.
Zo zet je het vast in je eigen werkproces
Met een paar regels Python draai je dezelfde transcriptie over een hele map met opnames, in het Nederlands en met je eigen vakwoorden erin. Dit is het minimale voorbeeld uit de documentatie, aangepast naar nl-NL:
from google import genai
client = genai.Client()
audio_file = client.files.upload(file="klantgesprek.mp3")
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}],
generation_config={
"transcription_config": {
"language_codes": ["nl-NL"],
"custom_vocabulary": ["Moneybird", "SEPA-incasso", "Van der Meulen"],
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
},
}
},
)
print(interaction.output_text)Drie instellingen doen het werk. Met language_codes zet je de taal vast. Met custom_vocabulary geef je het model je eigen woorden mee: productnamen, klantnamen, afkortingen uit je branche. Dat mag tot duizend termen, al zegt Google dat de meeste klanten het beste resultaat halen met een lijstje van rond de honderd. En met diarization_mode laat je het model bijhouden wie er aan het woord is, tot acht sprekers, al is de toewijzing vanaf drie sprekers nog experimenteel.
Wil je smart-opmaak in plaats van letterlijke tekst, dan vervang je het hele mode-blok door "mode": "smart". En haal je dan de sprekerherkenning eruit, want die twee gaan niet samen.
Zo’n script is meestal de eerste schakel van iets groters: transcript eruit, samenvatting erin, actiepunten naar je projecttool. Hoe je meerdere AI-sessies dat werk aan elkaar laat doorgeven, staat in ons artikel over Claude-sessies die elkaar berichten sturen. Wil je zulke schakels niet zelf onderhouden, dan is dat precies het werk dat de AI-agents van Pantheon voor mkb-bedrijven doen.
Wat kost het en waar loopt het vast?
Een uur opname uitschrijven kost ongeveer 30 dollarcent, omgerekend een kwartje tot dertig eurocent exclusief btw. De live-variant is met ongeveer 54 dollarcent per uur bijna twee keer zo duur, omdat je daar voor de snelheid betaalt.
| Wat | gemini-3.5-transcribe (opnames) | gemini-3.5-transcribe-live |
|---|---|---|
| Audio-invoer | $2,00 per miljoen tokens | $3,50 per miljoen tokens |
| Tekstuitvoer | $12,00 per miljoen tokens | $21,00 per miljoen tokens |
| Omgerekend per uur | circa $0,30 | circa $0,54 |
| Maximale lengte | 1 uur per verzoek, 30 minuten met sprekerherkenning of tijdstempels | 10 minuten per sessie |
| Gratis proberen | ja, maar Google mag je invoer gebruiken | ja, met dezelfde beperking |

Dan de scherpe randjes, want die zijn er. Een ontwikkelaar die het model juist op stilte en ruis testte, meldde op Hacker News dat het model netjes zijn mond hield in plaats van tekst te verzinnen, maar dat precies twintig seconden stilte een foutmelding oplevert. Dat is het soort detail waar je bij een lange opname met een koffiepauze zomaar tegenaan loopt.
Nog twee grenzen om te kennen. Rambler, de dicteerfunctie in Gboard op Android, is geen knop die je aanzet maar een verbetering die per toestel wordt uitgerold, voorlopig vooral op recente Pixel- en Samsung-telefoons. En de dicteerfunctie in de Gemini-app op de Mac, waar je met de fn-toets in elk venster kunt inspreken, is volgens de handleiding van Google voorlopig alleen in het Engels beschikbaar. Voor Nederlands werk blijft het dus AI Studio of de API.
Mag je een klantgesprek zomaar opnemen?
Opnemen mag als je zelf aan het gesprek deelneemt, maar zodra je als bedrijf die opname verwerkt en bewaart, gelden de gewone AVG-regels. Een transcript van een klantgesprek is een verzameling persoonsgegevens, en een AI-leverancier die dat bestand verwerkt is jouw verwerker.
- Zeg aan het begin van het gesprek dat je opneemt en waarvoor. Dat kost drie seconden en voorkomt de meeste discussies.
- Leg vast waarom je opneemt en hoe lang je bewaart. Verslag klaar en goedgekeurd betekent: opname weg.
- Regel een verwerkersovereenkomst met de leverancier en kies de betaalde variant, want alleen daar belooft Google je bestanden niet voor productverbetering te gebruiken.
- Wees extra terughoudend bij gesprekken over gezondheid, functioneren of andere gevoelige onderwerpen. Daar is een transcript in de cloud zelden de goedkoopste oplossing voor je probleem.
Notulen wel, contractteksten nog niet
Voor interne verslagen, spraakmemo’s en ingesproken concepten is dit vandaag al bruikbaar, en spotgoedkoop vergeleken met de tijd die je er zelf in stopt. Een uur vergadering uittypen kost een medewerker al snel twee uur; dertig cent aan rekenkracht plus een half uur nalezen is een andere rekensom.
Voor letterlijke citaten, contractafspraken en klachtdossiers is nalezen door een mens nog steeds verplicht huiswerk, zeker in de smart-modus. En bij gesprekken waarin Nederlands en Engels door elkaar lopen met veel vakjargon blijft het wisselvallig: een tester die twintig spraakmodellen naast elkaar zette op meertalige vergaderingen kwam op Hacker News nog altijd uit bij andere modellen.
De goedkoopste manier om erachter te komen aan welke kant jouw werk valt: pak een oude opname van vijf minuten, draai hem twee keer, één keer in smart en één keer in verbatim, en leg de twee transcripten naast elkaar. Die test kost je nog geen halve cent en een kwartier. Meer artikelen over dit soort praktijkproeven staan op ons blog.
Veelgestelde vragen
Wat is Gemini 3.5 Transcribe?
Gemini 3.5 Transcribe is het spraak-naar-tekstmodel dat Google op 26 augustus 2026 uitbracht. Het schrijft opnames en live gesprekken uit in ruim 85 talen, verwijdert stopwoorden en zelfcorrecties en maakt de tekst automatisch op.
Werkt Gemini 3.5 Transcribe in het Nederlands?
Ja. Nederlands staat als nl-NL in de talen die Google heeft getest, en je kunt de taal in de API expliciet vastzetten. Google publiceert geen apart foutpercentage voor het Nederlands, dus test het met een eigen opname.
Wat kost het om een uur audio uit te schrijven?
Ongeveer 30 dollarcent per uur opgenomen audio, oftewel rond een kwartje tot dertig eurocent exclusief btw. De live-variant kost ongeveer 54 dollarcent per uur. Er is ook een gratis niveau om mee te testen.
Mag ik een klantgesprek gratis testen in Google AI Studio?
Beter van niet. In de gratis variant gebruikt Google je invoer om producten te verbeteren en kunnen menselijke beoordelaars die inzien. Google adviseert in de eigen voorwaarden om daar geen vertrouwelijke of persoonlijke informatie in te zetten.
Wat is het verschil tussen de smart- en de verbatim-modus?
Verbatim schrijft letterlijk op wat er gezegd is en is de standaard in de API. Smart haalt stopwoorden en zelfcorrecties weg en maakt de tekst op, maar kan daarbij nuance verliezen en werkt niet samen met sprekerherkenning of tijdstempels per woord.