AI-röst och telefoni – riktiga samtal, riktiga agenter
Rösten är tillbaka – men inte som en IVR. Vi bygger AI-röstagenter som hanterar riktiga kundsamtal från början till slut: tidsbokning, supportärenden, kvalificering av utgående samtal – under 700ms latens, med de skyddsräcken som hindrar dem från att gå utanför manus på en inspelad linje.
- 1Ljud inTelefonilagret (Twilio/LiveKit) strömmar ljudet
- 2Tal till textStreamande STT (Deepgram, Whisper)
- 3LLM beslutarVerktygsval, RAG, kontroll mot skyddsräcken
- 4Verktyg / APIKalender, CRM, ärendesystem
- 5Text till talStreamande TTS (ElevenLabs, Cartesia)
Latens under ~700ms till första token är gränsen för att det ska ”kännas som en människa”.
Det här får du
När det passar
- Du hanterar volym av repetitiva samtal (tidsbokning, kvalificering, förstalinjens support) där en människa är överkvalificerad
- Du kan mäta framgång: genomförda bokningar, lösta ärenden, samtal som hanteras utan eskalering
- Ett misstag går att reparera – en missad bokning kan bekräftas om igen, det handlar inte om liv och hälsa
- Du är beredd att börja smalt (en samtalstyp) och utöka när utvärderingsramverket visar att det är säkert
När det inte passar
- Samtalstypen är känslomässigt känslig (kris, klagomål, känslig vård) – röstagenter är fel verktyg för det
- Volymen är för låg för att motivera bygget – under ~5k samtal/månad är det oftast billigare med en mänsklig kundtjänst
- Din telefonilösning är proprietär och stängd för integration – vi kan inte koppla till det vi inte kommer åt
Process
Vecka 1: design av samtalsflödet och definition av verktygskontrakt. Vecka 2–3: en latensfokuserad prototyp med en samtalstyp, hela vägen igenom. Vecka 4–6: skyddsräcken, utvärderingsramverk och skuggläge mot riktiga samtal (agenten lyssnar men agerar inte). Vecka 7–10: live med en liten andel av trafiken, som skalas upp bakom en feature flag när måttet håller.
Hela leveransprocessenPrissättning
Fast pris för den första samtalstypen: $80–180k beroende på integrationsytan. Kvartalsuppdrag med en pod för att expandera till fler samtalstyper. Infrastrukturkostnaden per samtal (telefoni + STT/TTS + LLM) landar normalt på $0.08–0.30/samtal i skala.
Se våra samarbetsformerSå skulle vi bygga det
Blueprints: exempelprojekt med planen, arkitekturen och målen vi skulle utgå från.
Vanliga frågor
- Hur skiljer sig det här från en IVR?
- IVR-system använder stela menyer och gör användare frustrerade. Röstagenter förstår fritt tal, ställer följdfrågor och anropar API:er för att faktiskt slutföra uppgiften. Arkitekturen är också helt annorlunda – en IVR är ett träd, en röstagent är en LLM med verktyg.
- Hur är det med dialekter, väntemusik och dåliga uppkopplingar?
- Alla verkliga problem vi mäter mot. Vi kör skuggläge (agenten lyssnar men agerar inte) på en del av din riktiga samtalstrafik under vecka 4–6, så att vi mäter prestanda på dina egna kunder – inte på iscensatta testsamtal.
- Kan agenten eskalera till en människa?
- Ja, och på ett smidigt sätt – en varm överkoppling med kontext, inte ett ”kopplar dig nu” följt av tystnad. Vi designar eskaleringen till en människa som ett förstklassigt flöde, inte som en reservlösning, eftersom det är där de flesta röstprojekt misslyckas.
- Är det här förenligt med TCPA, GDPR och krav på samtycke från båda parter?
- Ja, det är inbyggt från grunden – information vid samtalets start, insamling av samtycke, regler för hur länge inspelningar sparas och integration mot spärrlistor (DNC) är en del av bygget. Vi går igenom just dina jurisdiktioner och branscher i discoveryfasen.

Vem som bygger det
Vårt eget team, som arbetar från vårt kontor i Istočno Sarajevo, Bosnien och Hercegovina. Ingenjörerna på ditt behovssamtal är samma personer som bygger det.
Möt teamet