Voz
voicev0.3.0Inline-Sprachmodus im Chat: Diktat und freihändige Konversation mit live Sprachspektrum und 3 wählbaren Motoren
Beschreibung
Sprechen Sie im Chat, ohne ein Modal zu öffnen: Der Composer verwandelt sich in eine Sprachoberfläche mit reaktivem Spektrum, während der Gesprächsverlauf sichtbar bleibt. Zwei Erfahrungen über dasselbe Mikrofon — momentanes Diktat (Sprache zu Text zur Überprüfung vor dem Senden) und interaktiver freihändiger Sprachmodus (Sie sprechen, es wird automatisch gesendet, die KI antwortet laut). Drei austauschbare Motoren über die Einstellungen: 'cascaded' (Standard; nutzt den nativen Chatfluss, sodass alle Tools, Artefakte und KB erhalten bleiben und den Zustand der Auto Tools des Nutzers respektiert), 'audio-native' (Sprache-zu-Sprache in einem Anruf mit gpt-audio, geringere Latenz, reine Konversation ohne Tools) und 'elevenlabs-realtime' (niedrig-latente Duplexverbindung mit Unterbrechung/barge-in über Conversational AI). Unterstützt BYOK: Jeder Nutzer kann seinen eigenen ElevenLabs-Schlüssel verwenden (verschlüsselt im Ruhezustand) oder den des Systems.
Funktionen (6)
Tippen Sie auf das Mikrofon: Sprechen Sie und der Text erscheint im Eingabefeld zur Überprüfung vor dem Senden
Halten Sie gedrückt: freihändige Konversation mit VAD bei Stille; die KI antwortet laut
Reaktiver Sprachvisualisierer im eigenen Composer (Web Audio), ohne Modale. Unterschiedliche Farben pro Runde
Der Standardmotor erbt den Zustand der Auto Tools: Artefakte, KB und Werkzeuge bleiben verfügbar
cascaded · audio-native (gpt-audio, niedrige Latenz) · elevenlabs-realtime (Duplex mit barge-in)
Jeder Nutzer kann seinen eigenen API-Schlüssel von ElevenLabs verwenden, verschlüsselt mit AES-256-GCM
Changelog
- Phase 3: ElevenLabs Realtime-Motor (signed URL + Duplex-WebSocket, barge-in)
- BYOK pro Nutzer verschlüsselt (secret-vault AES-256-GCM): Endpunkte /key und /realtime/session
- Plan-Gate + konfigurierbares obligatorisches BYOK für Realtime
- UI der Einstellungen im Superadmin (Motor/Stimme/Agent + Verwaltung des BYOK-Schlüssels)
- Phase 2: TTS von hoher Qualität über ttsService (ElevenLabs/AIML) mit reaktivem Spektrum zum realen Audio
- Audio-native Motor (openai/gpt-audio) Sprache-zu-Sprache in einem Anruf
- Endpunkte /voices und /audio-chat (Konvertierung webm→mp3 mit ffmpeg-static)
- Phase 1: Diktat (A) End-to-End (getUserMedia → /stt Whisper → Eingabe)
- Sprachmodus (B) cascaded mit VAD bei Stille + Sprachsynthese-Vorlesung
- Web Audio-Spektrum, Mikro inline im Composer (Anker von 1 Zeile in index.ejs)