Ir al contenido principal
    Voz y telefonía con IA

    Voz y telefonía con IA: llamadas reales, agentes reales

    La voz ha vuelto, y no como un IVR. Construimos agentes de voz con IA que gestionan llamadas reales de principio a fin (reserva de citas, triaje de soporte, cualificación saliente) con una latencia inferior a 700 ms y las salvaguardas necesarias para que no se salgan del guion en una línea grabada.

    Qué ocurre en cada llamada, en milisegundos
    1. 1
      Entrada de audio
      La capa de telefonía (Twilio/LiveKit) transmite el audio
    2. 2
      Voz → texto
      STT en streaming (Deepgram, Whisper)
    3. 3
      Decisión del LLM
      Enrutamiento de herramientas, RAG y comprobación de salvaguardas
    4. 4
      Herramienta / API
      Calendario, CRM, sistema de tickets
    5. 5
      Texto → voz
      TTS en streaming (ElevenLabs, Cartesia)

    Una latencia de primer token por debajo de los 700 ms es el umbral de «parece una persona».

    Qué obtienes

    Arquitectura de voz completa: telefonía (Twilio, Plivo, SignalWire), capa en tiempo real (LiveKit, Vapi, Pipecat), STT/TTS y el LLM que decide
    Latencia de primer token inferior a 700 ms: el límite entre «parece una persona» y «parece un bot»
    Integración con herramientas y API para que el agente haga cosas de verdad: reservar en tu calendario, abrir tickets, actualizar el CRM
    Gestión de interrupciones (barge-in) y escalado sin fricción a una persona cuando el agente no está seguro
    Cumplimiento normativo para llamadas grabadas: TCPA, RGPD y consentimiento de las dos partes, integrado en el flujo de la llamada, no añadido después
    Sistema de evaluación con transcripciones de llamadas reales, para que cada release dependa de la calidad medida y no de la sensación
    Modelo de coste por llamada: voz, LLM y transcripción se acumulan rápido, y lo dimensionamos para una economía unitaria que funcione

    Cuándo encaja

    • Gestionas un volumen de llamadas repetitivas (citas, cualificación, soporte de primer nivel) para el que una persona es un recurso desaprovechado
    • Puedes medir el éxito: citas completadas, tickets resueltos, llamadas gestionadas sin escalado
    • Un fallo es recuperable: una cita perdida se puede reconfirmar, no es una llamada de emergencia vital
    • Estás dispuesto a empezar acotado (un solo tipo de llamada) y ampliar cuando el sistema de evaluación demuestre que es seguro

    Cuándo no

    • El tipo de llamada es emocionalmente sensible (crisis, reclamaciones, temas médicos delicados): ahí un agente de voz no es la solución
    • El volumen es demasiado bajo para justificar el desarrollo: por debajo de ~5.000 llamadas al mes, un equipo humano suele salir más barato
    • Tu sistema telefónico es propietario y la integración está cerrada: no podemos conectar lo que no podemos alcanzar

    Proceso

    Semana 1: diseño del flujo de llamada y definición de los contratos de herramientas. Semanas 2–3: prototipo centrado en la latencia con un tipo de llamada de principio a fin. Semanas 4–6: salvaguardas, sistema de evaluación y modo sombra sobre llamadas reales (el agente escucha, pero no actúa). Semanas 7–10: en producción con una parte pequeña del tráfico, ampliando detrás de un feature flag cuando la métrica se mantiene.

    Proceso de entrega completo

    Precios

    Desarrollo a precio cerrado para el primer tipo de llamada: $80–180k según el alcance de la integración. Colaboración trimestral con un pod para ampliar a otros tipos de llamada. El coste de infraestructura por llamada (telefonía + STT/TTS + LLM) suele situarse en $0.08–0.30 por llamada a escala.

    Ver modelos de colaboración

    Preguntas frecuentes

    ¿En qué se diferencia de un IVR?
    Los IVR usan menús rígidos que frustran a los usuarios. Los agentes de voz entienden el habla libre, hacen preguntas para aclarar dudas y llaman a API para completar la tarea de verdad. La arquitectura también es completamente distinta: un IVR es un árbol de decisiones; un agente de voz es un LLM con herramientas.
    ¿Y los acentos, la música de espera y las conexiones malas?
    Son problemas reales que medimos desde el principio. Durante las semanas 4–6 ejecutamos el modo sombra (el agente escucha, pero no actúa) sobre una parte de tu tráfico real de llamadas, para medir el rendimiento con tus clientes de verdad, no con llamadas de prueba preparadas.
    ¿Puede el agente escalar a una persona?
    Sí, y sin fricción: una transferencia con contexto, no un «te conecto ahora» seguido de silencio. Diseñamos el escalado a una persona como un flujo de primera clase, no como un recurso de último momento, porque ahí es donde fallan la mayoría de los proyectos de voz.
    ¿Cumple con TCPA, RGPD y el consentimiento de las dos partes?
    Sí, por diseño: el guion de aviso al inicio de la llamada, la captura del consentimiento, las normas de retención de las grabaciones y la integración con las listas de exclusión (DNC) forman parte del desarrollo. En el discovery lo revisamos frente a tus jurisdicciones y sectores concretos.
    Ingenieros de TekPiq en una sesión de arquitectura frente a la pizarra; uno de ellos dibuja el modelo de datos
    Sesión de arquitectura en nuestra oficina: los detalles de cliente en la pizarra están difuminados.

    Quién lo construye

    Nuestro propio equipo, que trabaja desde nuestra oficina en Istočno Sarajevo, Bosnia y Herzegovina. Los ingenieros de tu llamada para definir el alcance son quienes lo construyen.

    Conoce al equipo

    Voz y telefonía con IA: ¿hablamos?

    Llamada de 30 minutos para definir el alcance. Sin compromiso ni presión comercial.