Zum Hauptinhalt springen
    KI-Sprachassistenten & Telefonie

    KI-Sprachassistenten & Telefonie – echte Anrufe, echte Agenten

    Sprache ist zurück – aber nicht als IVR. Wir bauen KI-Voice-Agenten, die echte Kundenanrufe komplett übernehmen: Terminbuchung, Support-Triage, ausgehende Qualifizierung – mit einer Latenz unter 700ms und den Leitplanken, die verhindern, dass sie auf einer aufgezeichneten Leitung vom Skript abweichen.

    Was bei jedem Anruf passiert – in Millisekunden
    1. 1
      Audio-Eingang
      Telefonie-Schicht (Twilio/LiveKit) streamt Audio
    2. 2
      Sprache → Text
      Streaming-STT (Deepgram, Whisper)
    3. 3
      LLM entscheidet
      Tool-Routing, RAG, Prüfung der Leitplanken
    4. 4
      Tool / API
      Kalender, CRM, Ticketsystem
    5. 5
      Text → Sprache
      Streaming-TTS (ElevenLabs, Cartesia)

    Eine Latenz bis zum ersten Token von unter ~700ms ist die Schwelle für „fühlt sich wie ein Mensch an“.

    Was Sie bekommen

    Voice-Architektur über Telefonie (Twilio, Plivo, SignalWire), Realtime-Schicht (LiveKit, Vapi, Pipecat), STT/TTS und das LLM als Gehirn dahinter
    Latenz unter 700ms bis zum ersten Token – die Grenze zwischen „fühlt sich wie ein Mensch an“ und „fühlt sich wie ein Bot an“
    Tool-/API-Integration, damit der Agent wirklich etwas erledigen kann: einen Termin in Ihrem Kalender buchen, Tickets anlegen, CRMs aktualisieren
    Umgang mit Unterbrechungen, Barge-in und ein sauberer Übergang an einen Menschen, wenn sich der Agent nicht sicher ist
    Compliance für aufgezeichnete Anrufe: TCPA, DSGVO, Zwei-Parteien-Einwilligung – im Gesprächsablauf verankert, nicht nachträglich angeflanscht
    Eval-Suite mit echten Gesprächsmitschriften, damit jedes Release an der Qualität gemessen wird und nicht am Bauchgefühl
    Kostenmodell pro Anruf – Voice, LLM und Transkription summieren sich schnell, und wir dimensionieren es auf Unit Economics, die tatsächlich funktionieren

    Wann es passt

    • Sie haben ein hohes Volumen an repetitiven Anrufen (Terminbuchung, Qualifizierung, First-Level-Support), für die ein Mensch überqualifiziert ist
    • Sie können den Erfolg messen: abgeschlossene Buchungen, gelöste Tickets, Anrufe ohne Eskalation
    • Fehler sind korrigierbar – eine verpasste Buchung lässt sich erneut bestätigen, es geht nicht um sicherheitskritische Anrufe
    • Sie sind bereit, schmal zu starten (ein Anruftyp) und erst zu erweitern, wenn die Eval-Suite zeigt, dass es sicher ist

    Wann nicht

    • Der Anruftyp ist emotional sensibel (Krisen, Beschwerden, sensible medizinische Themen) – dafür sind Voice-Agenten die falsche Wahl
    • Das Volumen ist zu gering, um den Aufbau zu rechtfertigen – unter rund 5.000 Anrufen im Monat ist ein menschliches Team meist günstiger
    • Ihr Telefonsystem ist proprietär und für Integrationen geschlossen – wir können nicht anbinden, was wir nicht erreichen

    Ablauf

    Woche 1: Design des Gesprächsablaufs und Definition der Tool-Contracts. Wochen 2–3: latenzoptimierter Prototyp mit einem Anruftyp end-to-end. Wochen 4–6: Leitplanken, Eval-Suite und Schattenbetrieb bei echten Anrufen (der Agent hört mit, handelt aber nicht). Wochen 7–10: Livebetrieb mit einem kleinen Traffic-Anteil, der hinter einem Feature-Flag hochgefahren wird, sobald sich die Kennzahl bestätigt.

    Der vollständige Ablauf

    Preise

    Festpreis für den ersten Anruftyp: $80–180k, je nach Integrationsumfang. Quartalsweise Pod-Zusammenarbeit für die Erweiterung auf weitere Anruftypen. Die Infrastrukturkosten pro Anruf (Telefonie + STT/TTS + LLM) liegen im großen Maßstab typischerweise bei $0.08–0.30/Anruf.

    Zusammenarbeitsmodelle ansehen

    FAQ

    Was unterscheidet das von einem IVR?
    IVR-Systeme arbeiten mit starren Menüs und frustrieren Nutzer. Voice-Agenten verstehen frei gesprochene Sprache, stellen Rückfragen und rufen APIs auf, um die Aufgabe wirklich zu erledigen. Auch die Architektur ist völlig anders – ein IVR ist ein Entscheidungsbaum, ein Voice-Agent ist ein LLM mit Tools.
    Was ist mit Akzenten, Warteschleifenmusik und schlechten Verbindungen?
    Alles reale Probleme, gegen die wir testen. Wir betreiben in den Wochen 4–6 einen Schattenbetrieb (der Agent hört mit, handelt aber nicht) auf einem Ausschnitt Ihres echten Anrufaufkommens, damit wir die Leistung an Ihren tatsächlichen Kunden messen – nicht an gestellten Testanrufen.
    Kann der Agent an einen Menschen übergeben?
    Ja, und zwar sauber – eine persönliche Übergabe mit Kontext, kein „ich verbinde Sie jetzt“ gefolgt von Stille. Wir gestalten den Übergang an einen Menschen als vollwertigen Ablauf, nicht als Notlösung – genau daran scheitern die meisten Voice-Projekte.
    Ist das TCPA-/DSGVO-konform und erfüllt die Zwei-Parteien-Einwilligung?
    Das ist von Anfang an so konzipiert – Hinweistexte zu Gesprächsbeginn, Erfassung der Einwilligung, Regeln zur Aufbewahrung von Aufzeichnungen und eine Anbindung an Sperrlisten (DNC) sind Teil des Aufbaus. Die genauen Vorgaben für Ihre Rechtsräume und Branchen prüfen wir in der Discovery.
    TekPiq-Entwickler in einer Architektur-Session am Whiteboard; einer von ihnen skizziert das Datenmodell
    Architektur-Session in unserem Büro – Kundendetails auf dem Board sind unkenntlich gemacht.

    Wer es baut

    Unser eigenes Team arbeitet aus unserem Büro in Istočno Sarajevo, Bosnien und Herzegowina. Die Engineers in Ihrem Erstgespräch sind dieselben, die es später auch bauen.

    Das Team kennenlernen

    Bereit für ein Gespräch über KI-Sprachassistenten & Telefonie?

    30-minütiges Erstgespräch. Unverbindlich und ohne Verkaufsdruck.