NAiOS IconNAiOS Logo
Zurück zum Katalog

Voz

voicev0.3.0

Inline-Sprachmodus im Chat: Diktat und freihändige Konversation mit live Sprachspektrum und 3 wählbaren Motoren

ProductividadvozvoicedictadottssttrealtimeelevenlabsbyokNAiOS Team
Funktionen
6
Version
0.3.0
Lizenz
free
Dienste

Beschreibung

Sprechen Sie im Chat, ohne ein Modal zu öffnen: Der Composer verwandelt sich in eine Sprachoberfläche mit reaktivem Spektrum, während der Gesprächsverlauf sichtbar bleibt. Zwei Erfahrungen über dasselbe Mikrofon — momentanes Diktat (Sprache zu Text zur Überprüfung vor dem Senden) und interaktiver freihändiger Sprachmodus (Sie sprechen, es wird automatisch gesendet, die KI antwortet laut). Drei austauschbare Motoren über die Einstellungen: 'cascaded' (Standard; nutzt den nativen Chatfluss, sodass alle Tools, Artefakte und KB erhalten bleiben und den Zustand der Auto Tools des Nutzers respektiert), 'audio-native' (Sprache-zu-Sprache in einem Anruf mit gpt-audio, geringere Latenz, reine Konversation ohne Tools) und 'elevenlabs-realtime' (niedrig-latente Duplexverbindung mit Unterbrechung/barge-in über Conversational AI). Unterstützt BYOK: Jeder Nutzer kann seinen eigenen ElevenLabs-Schlüssel verwenden (verschlüsselt im Ruhezustand) oder den des Systems.

Funktionen (6)

Inline-Diktat

Tippen Sie auf das Mikrofon: Sprechen Sie und der Text erscheint im Eingabefeld zur Überprüfung vor dem Senden

Interaktiver Sprachmodus

Halten Sie gedrückt: freihändige Konversation mit VAD bei Stille; die KI antwortet laut

Live-Spektrum

Reaktiver Sprachvisualisierer im eigenen Composer (Web Audio), ohne Modale. Unterschiedliche Farben pro Runde

Behalten Sie Ihre Tools (cascaded)

Der Standardmotor erbt den Zustand der Auto Tools: Artefakte, KB und Werkzeuge bleiben verfügbar

Austauschbare Motoren

cascaded · audio-native (gpt-audio, niedrige Latenz) · elevenlabs-realtime (Duplex mit barge-in)

BYOK (eigener Schlüssel)

Jeder Nutzer kann seinen eigenen API-Schlüssel von ElevenLabs verwenden, verschlüsselt mit AES-256-GCM

Changelog

v0.3.02026-05-29
  • Phase 3: ElevenLabs Realtime-Motor (signed URL + Duplex-WebSocket, barge-in)
  • BYOK pro Nutzer verschlüsselt (secret-vault AES-256-GCM): Endpunkte /key und /realtime/session
  • Plan-Gate + konfigurierbares obligatorisches BYOK für Realtime
  • UI der Einstellungen im Superadmin (Motor/Stimme/Agent + Verwaltung des BYOK-Schlüssels)
v0.2.02026-05-29
  • Phase 2: TTS von hoher Qualität über ttsService (ElevenLabs/AIML) mit reaktivem Spektrum zum realen Audio
  • Audio-native Motor (openai/gpt-audio) Sprache-zu-Sprache in einem Anruf
  • Endpunkte /voices und /audio-chat (Konvertierung webm→mp3 mit ffmpeg-static)
v0.1.02026-05-29
  • Phase 1: Diktat (A) End-to-End (getUserMedia → /stt Whisper → Eingabe)
  • Sprachmodus (B) cascaded mit VAD bei Stille + Sprachsynthese-Vorlesung
  • Web Audio-Spektrum, Mikro inline im Composer (Anker von 1 Zeile in index.ejs)