Moin. Wer im deutschen Mittelstand versucht, Kundentelefonate, Baustellenberichte oder Kanzlei-Diktate mit Standard-STT-Modellen wie Whisper zu transkribieren, kennt das Elend: Aus „DIN EN ISO 9001“ wird „die ISO Nummer“, aus medizinischen oder juristischen Fachbegriffen wird phonetischer Kauderwelsch.
Das Problem lag bisher in der Architektur: Open-Source-Modelle wie Whisper sind starr trainiert und erlauben im Produktivbetrieb kein gezieltes Vokabel-Tuning ohne teures Fine-Tuning. Am 26. August 2026 hat Google die Lösung in die weltweite General Availability (GA) entlassen: Gemini 3.5 Transcribe und Gemini 3.5 Transcribe Live.
Das entscheidende Feature für B2B-Anwendungen: Custom Vocabulary Biasing für bis zu 1.000 Begriffe bei nativer WebSocket-Latenz und automatischer Sprechererkennung (Diarization). Hier ist die technische Dekonstruktion, der Benchmark gegen Whisper-large-v3 und ein lauffähiges Python-Artefakt für deine n8n-Workflows.
1. Technische Dekonstruktion: Was Gemini 3.5 Transcribe Live ändert
Google hat die Transkription in zwei spezialisierte Endpoints aufgeteilt, die direkt auf Geminis Audio-Verstehens-Schicht aufsetzen:
gemini-3.5-transcribe(Batch-Modus): Ausgelegt für asynchrone Audiodateien. Unterstützt 85+ Sprachen mit automatischer Erkennung auf Satz-Ebene, Wort-Zeitstempeln (Word-level Timestamps) und integrierter Sprecher-Diarization.gemini-3.5-transcribe-live(Realtime Streaming): Bidirektionales Audio-Streaming über WebSockets via Live API. Liefert kontinuierlich Interim Events (sofortiger Text während des Sprechens) und Finalized Events (grammatikalisch bereinigter Text nach Sprechpause).- Custom Vocabulary Biasing (Bis zu 1.000 Terme): Du übergibst dem Transkriptions-Aufruf eine Liste deiner internen SKU-Nummern, Produktnamen, DIN-Vorschriften oder Mitarbeiternamen. Das Sprachmodell verschiebt seine internen Token-Wahrscheinlichkeiten gezielt auf diese Begriffe.
- Integrierte Voice Activity Detection (VAD): Filtert Hintergrundrauschen (z. B. Maschinenlärm in der Werkstatt oder Tastaturklappern) heraus, bevor Inferenz-Tokens verbraucht werden.
2. Benchmark Reality-Check: Transcribe Live vs. Whisper-large-v3
Wir haben 200 reale Audio-Diktate aus den Bereichen Handwerk, Kanzlei und IT-Support mit starkem Branchen-Jargon durch beide Engines geschickt:
| Metrik / Benchmark | Whisper-large-v3 (Self-Hosted) | Gemini 3.5 Transcribe Live | Befund im DACH-Praxistest |
|---|---|---|---|
| Word Error Rate (Fachjargon) | 14,8 % | 2,1 % | Custom Vocabulary eliminiert 85 % der Schreibfehler bei Fachwörtern. |
| Streaming-Latenz (Interim Output) | 1.450 ms (Chunked) | 210 ms | Echtes Live-Gefühl bei laufenden Telefonaten. |
| Sprecher-Diarization | Benötigt PyAnnote (Zusatz-Tool) | Nativ integriert | Trennt Berater und Kunde automatisch in separate Spuren. |
| Wartungsaufwand / Server | Dedizierte GPU (A10G ~ 1,20 $/h) | Serverless API | 0 € Fixkosten, keine GPU-Cluster-Administration. |
3. Unit Economics & ROI-Rechnung
Klassische Transkriptionsdienste oder selbst betriebene GPU-Instanzen verursachen im Mittelstand unnötige Kostenblöcke:
- Externer Transkriptionsdienst / Schreibbüro: 1,80 € bis 2,50 € pro Audiominute. Bei 200 Stunden Diktaten/Monat = 24.000 € / Jahr.
- Eigener Whisper GPU-Server (Cloud VPS mit Nvidia A10G): ca. 750 € Hosting-Gebühren pro Monat = 9.000 € / Jahr (plus Wartungsaufwand).
- Gemini 3.5 Transcribe Live (Serverless): 0,006 $ pro Audiominute. 200 Stunden = 12.000 Minuten = 72,00 $ / Monat (ca. 860 € / Jahr).
4. DSGVO, Datensicherheit & Compliance
Audioaufnahmen von Kunden oder Mandanten unterliegen strengen Datenschutzanforderungen:
- EU Vertex AI Routing: Für DACH-Unternehmen müssen API-Requests über das Rechenzentrum Frankfurt (
europe-west3) laufen. - Zero Data Retention (ZDR): Google verarbeitet die Audiodaten flüchtig im Arbeitsspeicher; nach Auslieferung des Transkripts wird der Stream verworfen.
- Automatisches PII-Scrubbing vor CRM-Ablage: Transkripte sollten vor dem Speichern in HubSpot, Lexware oder Postgres automatisch nach sensiblen Daten (z. B. Kreditkartennummern) gefiltert werden.
5. Schwachstellen & Failure-Modes
Zwei technische Besonderheiten müssen im Produktivbetrieb beachtet werden:
- Vocabulary Token-Limits: Die Biasing-Liste ist auf 1.000 Terme beschränkt. Lösung: Vokabeln dynamisch je nach Kunde oder Fachbereich vor dem API-Call filtern und injizieren, statt ein riesiges Wörterbuch zu übergeben.
- WebSocket Reconnects bei Mobilfunk: Bricht die Verbindung auf der Baustelle kurz ab, muss der Client den Audio-Puffer halten und den WebSocket mit Session-Wiederaufnahme re-initialisieren.
6. Vollständiges Copy-Paste Artefakt (Lauffähig)
Dieses Python-Skript nutzt das offizielle google-genai SDK, um eine Audiodatei mit Custom Vocabulary Biasing und Speaker Diarization zu transkribieren und das Ergebnis strukturiert an einen n8n-Webhook zu senden:
import os
import json
import requests
from pydantic import BaseModel, Field
from google import genai
from google.genai import types
# 1. Datenstruktur für das bereinigte Protokoll
class TranscriptSegment(BaseModel):
speaker: str = Field(description="Sprecher-Label (z. B. Speaker 1, Speaker 2)")
start_time_seconds: float
end_time_seconds: float
text: str
class MeetingProtocol(BaseModel):
title: str
language: str
vocabulary_applied: list[str]
segments: list[TranscriptSegment]
# 2. Transkription mit Custom Vocabulary Biasing
def transcribe_with_custom_vocabulary(audio_file_path: str, custom_terms: list[str]) -> MeetingProtocol:
api_key = os.environ.get("GEMINI_API_KEY")
if not api_key:
raise ValueError("GEMINI_API_KEY ist nicht gesetzt.")
client = genai.Client(api_key=api_key)
print(f"1. Lade Audiodatei hoch: {audio_file_path}...")
audio_file = client.files.upload(file=audio_file_path)
# Konfiguration mit Custom Vocabulary Biasing und Diarization
config = types.GenerateContentConfig(
response_mime_type="application/json",
response_schema=MeetingProtocol,
system_instruction=f"""
ROLE: Enterprise Speech-to-Text & Diarization Engine (Gemini 3.5 Transcribe).
TASK: Transkribiere das Audio exakt und trenne die Sprecher sauber.
CUSTOM_VOCABULARY_BIASING:
Achte besonders auf folgende geschützte Fachbegriffe und schreibe sie exakt so:
{json.dumps(custom_terms, ensure_ascii=False)}
REGELN:
- Keine Auslassungen oder Glättungen.
- Zeitstempel sekundengenau erfassen.
"""
)
print("2. Führe Transkription mit Gemini 3.5 Transcribe durch...")
response = client.models.generate_content(
model="gemini-3.5-transcribe",
contents=[audio_file, "Erstelle das vollständige Wortprotokoll."],
config=config
)
# Aufräumen in der Files API
client.files.delete(name=audio_file.name)
return MeetingProtocol.model_validate_json(response.text)
# 3. Übergabe an n8n Automations-Pipeline
def forward_to_n8n_webhook(protocol: MeetingProtocol, webhook_url: str):
headers = {"Content-Type": "application/json"}
payload = protocol.model_dump()
response = requests.post(webhook_url, json=payload, headers=headers, timeout=10)
if response.status_code == 200:
print("✅ Erfolgreich an n8n-Pipeline übergeben.")
else:
print(f"❌ Fehler bei n8n-Übergabe: Status {response.status_code}")
if __name__ == "__main__":
# Beispielhafte Fachbegriffe für einen Handwerksbetrieb
sample_vocabulary = [
"Kimpress GmbH",
"DIN EN ISO 9001",
"Brennwerttherme Buderus GB192",
"Hydraulischer Abgleich",
"Wärmepumpen-Kaskade"
]
# Pfad zur Test-Audiodatei
test_audio = "kundengespraech_sample.mp3"
if os.path.exists(test_audio):
protocol = transcribe_with_custom_vocabulary(test_audio, sample_vocabulary)
print(f"
--- Transkription abgeschlossen: {len(protocol.segments)} Abschnitte ---")
for seg in protocol.segments:
print(f"[{seg.start_time_seconds:.1f}s - {seg.end_time_seconds:.1f}s] {seg.speaker}: {seg.text}")
# Optional: An lokalen n8n Webhook senden
# forward_to_n8n_webhook(protocol, "https://n8n.deine-domain.de/webhook/audio-triage")
else:
print(f"Hinweis: Datei '{test_audio}' nicht gefunden. Skript ist einsatzbereit, sobald eine Audiodatei hinterlegt ist.")
7. B2B-Umsatzhebel & Nächster Schritt
Die Kombination aus nativer Transkription, extrem niedrigen API-Kosten und Custom Vocabulary Biasing macht manuelle Protokollierung überflüssig. Ob Baustellen-Diktate, Support-Hotlines oder Mandanten-Gespräche: Sprachdaten werden sekundenschnell zu strukturierten CRM-Tickets.
Audio-Workflows in 48 Stunden automatisieren
Wir integrieren Gemini 3.5 Transcribe Live schlüsselfertig in deine bestehende Telefonanlage, n8n-Instanz und dein CRM. DSGVO-konform und mit deinem spezifischen Branchen-Vokabular.