Ich werde einen Voice-AI-Agenten mit elevenlabs, STT und LLM in Python erstellen


Über diesen Service
Automatische Übersetzung
Setze einen intelligenten Voice AI Agenten ein, der in Echtzeit zuhören, denken und sprechen kann.
Ich entwickle maßgeschneiderte konversationale Voice AI Architekturen in Python, die Low-Latency-Audio-Streaming mit LLMs und Sprachausgabe kombinieren.
Was ich liefere:
- End-to-End Voice Pipelines: Voice Activity Detection (VAD) + Whisper (STT) + LLM-Reasoning + ElevenLabs (TTS)
- Ultra-niedrige Latenz bei Audio-Routing via asynchrone Linux-Pipes
- Telegram Voice Calls Integration via Pyrogram
- Cloud-GPU-Bereitstellung (RunPod-Container-Worker, parallele Queue-Verarbeitung, dynamisches Scaling)
- Modulare Python-Backend mit isoliertem Audioaufnahme- und Syntheseprozess
Stack: Python, asyncio, ElevenLabs, Whisper, RunPod GPU, Pyrogram.
Bitte kontaktiere mich vor der Bestellung, um API-Zugangsdaten und Sprachlatenz-Anforderungen zu besprechen.
Lerne Moddie kennen
Fullstack web developer
- AusUkraine
- Mitglied seitOkt. 2024
- ⌀ Antwortzeit1 Stunde
Sprachen
Ukrainisch, Russisch, Englisch
Automatische Übersetzung
Mein Portfolio
FAQ
Automatische Übersetzung
Wie erreichst du niedrige Latenz bei der Sprachausgabe?
Ich streame Audio-Chunks direkt via asynchrone Linux-Pipes in den Player, ohne temporäre Audiodateien auf der Festplatte zu speichern, wodurch die Latenz unter 600 ms bleibt
Kann dieser Voice-Agent Anrufe über Telefon oder Telegram tätigen?
Ja, ich kann den Agenten mit Telegram-Sprachanrufen via Pyrogram oder externen Telefondiensten (Twilio/LiveKit) integrieren

