Hoppa till huvudinnehållet
    AI-röst och telefoni

    AI-röst och telefoni – riktiga samtal, riktiga agenter

    Rösten är tillbaka – men inte som en IVR. Vi bygger AI-röstagenter som hanterar riktiga kundsamtal från början till slut: tidsbokning, supportärenden, kvalificering av utgående samtal – under 700ms latens, med de skyddsräcken som hindrar dem från att gå utanför manus på en inspelad linje.

    Vad som händer under varje samtal, i millisekunder
    1. 1
      Ljud in
      Telefonilagret (Twilio/LiveKit) strömmar ljudet
    2. 2
      Tal till text
      Streamande STT (Deepgram, Whisper)
    3. 3
      LLM beslutar
      Verktygsval, RAG, kontroll mot skyddsräcken
    4. 4
      Verktyg / API
      Kalender, CRM, ärendesystem
    5. 5
      Text till tal
      Streamande TTS (ElevenLabs, Cartesia)

    Latens under ~700ms till första token är gränsen för att det ska ”kännas som en människa”.

    Det här får du

    Röstarkitektur som spänner över telefoni (Twilio, Plivo, SignalWire), realtidslager (LiveKit, Vapi, Pipecat), STT/TTS och själva LLM-hjärnan
    Under 700ms latens till första token – gränsen mellan ”känns som en människa” och ”känns som en bot”
    Verktygs- och API-integration så att agenten faktiskt kan utföra saker: boka i din kalender, skapa ärenden, uppdatera CRM-system
    Hantering av avbrott (barge-in) och en smidig eskalering till en människa när agenten är osäker
    Regelefterlevnad för inspelade samtal: TCPA, GDPR, samtycke från båda parter – inbyggt i samtalsflödet, inte påklistrat i efterhand
    Utvärderingsramverk med transkript från riktiga samtal, så att varje release grindas på kvalitet – inte på magkänsla
    Kostnadsmodell per samtal – röst, LLM och transkribering drar snabbt iväg, och vi dimensionerar för en enhetsekonomi som faktiskt går ihop

    När det passar

    • Du hanterar volym av repetitiva samtal (tidsbokning, kvalificering, förstalinjens support) där en människa är överkvalificerad
    • Du kan mäta framgång: genomförda bokningar, lösta ärenden, samtal som hanteras utan eskalering
    • Ett misstag går att reparera – en missad bokning kan bekräftas om igen, det handlar inte om liv och hälsa
    • Du är beredd att börja smalt (en samtalstyp) och utöka när utvärderingsramverket visar att det är säkert

    När det inte passar

    • Samtalstypen är känslomässigt känslig (kris, klagomål, känslig vård) – röstagenter är fel verktyg för det
    • Volymen är för låg för att motivera bygget – under ~5k samtal/månad är det oftast billigare med en mänsklig kundtjänst
    • Din telefonilösning är proprietär och stängd för integration – vi kan inte koppla till det vi inte kommer åt

    Process

    Vecka 1: design av samtalsflödet och definition av verktygskontrakt. Vecka 2–3: en latensfokuserad prototyp med en samtalstyp, hela vägen igenom. Vecka 4–6: skyddsräcken, utvärderingsramverk och skuggläge mot riktiga samtal (agenten lyssnar men agerar inte). Vecka 7–10: live med en liten andel av trafiken, som skalas upp bakom en feature flag när måttet håller.

    Hela leveransprocessen

    Prissättning

    Fast pris för den första samtalstypen: $80–180k beroende på integrationsytan. Kvartalsuppdrag med en pod för att expandera till fler samtalstyper. Infrastrukturkostnaden per samtal (telefoni + STT/TTS + LLM) landar normalt på $0.08–0.30/samtal i skala.

    Se våra samarbetsformer

    Vanliga frågor

    Hur skiljer sig det här från en IVR?
    IVR-system använder stela menyer och gör användare frustrerade. Röstagenter förstår fritt tal, ställer följdfrågor och anropar API:er för att faktiskt slutföra uppgiften. Arkitekturen är också helt annorlunda – en IVR är ett träd, en röstagent är en LLM med verktyg.
    Hur är det med dialekter, väntemusik och dåliga uppkopplingar?
    Alla verkliga problem vi mäter mot. Vi kör skuggläge (agenten lyssnar men agerar inte) på en del av din riktiga samtalstrafik under vecka 4–6, så att vi mäter prestanda på dina egna kunder – inte på iscensatta testsamtal.
    Kan agenten eskalera till en människa?
    Ja, och på ett smidigt sätt – en varm överkoppling med kontext, inte ett ”kopplar dig nu” följt av tystnad. Vi designar eskaleringen till en människa som ett förstklassigt flöde, inte som en reservlösning, eftersom det är där de flesta röstprojekt misslyckas.
    Är det här förenligt med TCPA, GDPR och krav på samtycke från båda parter?
    Ja, det är inbyggt från grunden – information vid samtalets start, insamling av samtycke, regler för hur länge inspelningar sparas och integration mot spärrlistor (DNC) är en del av bygget. Vi går igenom just dina jurisdiktioner och branscher i discoveryfasen.
    Utvecklare på TekPiq i ett arkitekturmöte vid whiteboarden, där en av dem skissar på datamodellen
    Arkitektursession på vårt kontor – kunduppgifter på tavlan är suddade.

    Vem som bygger det

    Vårt eget team, som arbetar från vårt kontor i Istočno Sarajevo, Bosnien och Hercegovina. Ingenjörerna på ditt behovssamtal är samma personer som bygger det.

    Möt teamet

    AI-röst och telefoni – ska vi prata?

    Ett 30 minuters behovssamtal. Förutsättningslöst och utan säljtryck.