Ich werde eine Whisper-Transkriptions-API für dein Produkt erstellen


Über diesen Service
Automatische Übersetzung
Ich habe eine Streaming-Sprachpipeline von Anfang bis Ende aufgebaut: Sprache zu Text mit Whisper, Text zu Sprache mit ElevenLabs, läuft auf AWS Bedrock mit Gesprächsspeicher.
Die meisten Transkriptions-Gigs verpacken die API und hören dort auf. Die schwierigen Teile kommen danach: lange Dateien, die timeouten, Latenz, die man bei einem Live-Anruf hört, Sprechertrennung und eine Rechnung, die schneller wächst als dein Nutzungsvolumen.
Was du bekommst:
- Whisper-Transkription mit Zeitstempeln und Spracherkennung
- Streaming, sodass der Text ankommt, während das Audio noch läuft
- Warteschlangen und Wiederholungen für lange oder fehlgeschlagene Dateien
- Kostenaufzeichnung pro Minute Audio
Mein Hintergrund ist Telekommunikation. Ich habe einen Master in Informationsnetzwerken von der Odessa National Academy of Telecommunications und bin CCNA-zertifiziert. Bei Siemens habe ich an einer industriellen 5G VoIP-Plattform mit End-to-End-Verschlüsselung in einem Team von 45 bis 50 Leuten gearbeitet.
Ich arbeite aus der Ukraine nach CET.
Sag mir dein Audio-Volumen und dein Latenzziel, und ich sage dir, was realistisch ist, bevor du bestellst.
Lerne Michael S. kennen
CTO and AI Developer, 18 Years: LangChain, RAG, Voice AI, Python Backends
- AusUkraine
- Mitglied seitFeb. 2023
- ⌀ Antwortzeit1 Stunde
Sprachen
Russisch, Ukrainisch, Englisch, Deutsch
Automatische Übersetzung
Mein Portfolio
FAQ
Automatische Übersetzung
Welchen Speech-to-Text-Engine benutzt du?
Standardmäßig Whisper, da es Akzente und Hintergrundgeräusche gut verarbeitet. Ich arbeite auch mit Alternativen wie Deepgram oder AssemblyAI, falls dein Projekt bereits auf einem von ihnen läuft oder eine Funktion braucht, die sie besser abdecken.
Unterstützt du Echtzeit- oder Streaming-Transkription?
Ja, ab dem Standard-Paket. Der Text kommt, während das Audio noch läuft, anstatt dass du auf das Ende der Datei warten musst, um etwas zu sehen.
Welche Sprachen werden unterstützt?
Whisper unterstützt Dutzende Sprachen out of the box, inklusive automatische Spracherkennung. Schick mir deine Zielsprachen, und ich bestätige die Abdeckung und weise auf mögliche Genauigkeitsabstriche hin, bevor du bestellst.
Kannst du Text-to-Speech hinzufügen, damit meine App zurücksprechen kann?
Ja, im Premium-Paket. Ich kombiniere die Transkription mit ElevenLabs für eine natürlich klingende Sprachausgabe, sodass du eine vollständige Sprach-in, Sprach-out-Pipeline hast, nicht nur Transkription.
Wie gehst du mit langen oder fehlgeschlagenen Audiodateien um?
Lange Dateien kommen in eine Warteschlange mit Wiederholungen ab dem Standard-Paket, sodass eine langsame oder fehlgeschlagene Aufgabe die anderen Uploads nicht blockiert oder die Anfrage timeoutet.
Kann das auf meinem eigenen Server oder Cloud-Konto laufen?
Ja. Im Premium-Paket deploye ich die Pipeline in deine eigene AWS- oder Azure-Umgebung, sodass Audio und Infrastruktur unter deiner Kontrolle bleiben.
Wie werden die Kosten berechnet, und kann ich sie kontrollieren?
Ich logge die Kosten pro Minute verarbeiteten Audios, damit du genau siehst, was jede Anfrage kostet, anstatt von der monatlichen Rechnung überrascht zu werden.
