Ir al contenido principal
    Edge AI e inferencia embebida

    Edge AI e inferencia embebida: IA que funciona sin conexión a la nube

    La inferencia de IA en la nube cuesta $0.002 por llamada, añade 200 ms de latencia y falla en cuanto se cae la conectividad. Para dispositivos IoT, sistemas de planta y apps móviles que necesitan IA en tiempo real, la inferencia en el dispositivo no es un capricho: es la arquitectura correcta.

    Inferencia en la nube frente a inferencia en el edge
    Dimensión
    Inferencia en la nube
    Una llamada a la API por petición
    Inferencia en el edge
    En el dispositivo, sin red
    Latencia150–400 ms (ida y vuelta)5–50 ms en el dispositivo
    Funciona sin conexión
    Coste a escala$0.002+ por llamadaHardware amortizado
    Privacidad de los datosLos datos salen del dispositivoNada sale del dispositivo
    Actualizaciones del modeloInstantáneas (del lado del servidor)Requieren un pipeline OTA
    Recomendado paraModelos grandes y de baja frecuenciaTiempo real, siempre activo, IoT
    La mayoría de los sistemas en producción combinan ambas: edge para las rutas críticas en latencia, nube para las cargas pesadas.

    Qué obtienes

    Pipeline de cuantización y compresión de modelos: cuantización INT8/FP16, poda y destilación para encajar en tu hardware objetivo sin sacrificar la precisión que de verdad necesitas
    Runtime en el dispositivo para iOS (Core ML, BNNS), Android (NNAPI, TFLite, MediaPipe), Linux embebido (ONNX Runtime, TensorRT, OpenVINO) y microcontroladores (TensorFlow Lite Micro, CMSIS-NN)
    Inferencia sin conexión con sincronización en la nube: degradación controlada cuando falla la conectividad, sincronización al recuperarla y un modelo de consistencia bien definido
    Optimización específica para NPU, GPU y DSP: Apple Neural Engine, Qualcomm Hexagon, Arm Ethos, NVIDIA Jetson
    Suite de benchmarking: latencia (p50/p95), throughput, consumo y comportamiento térmico sobre tu hardware real, no sobre un simulador
    Pipeline de entrega continua de modelos: actualizaciones OTA de los pesos del modelo sin necesidad de una nueva versión en la tienda de apps

    Cuándo encaja

    • Una latencia de inferencia por debajo de 50 ms es un requisito de producto que un viaje de ida y vuelta a la nube no puede cumplir
    • El dispositivo tiene conectividad intermitente o nula (industrial, rural, en vehículos, wearables)
    • El coste por llamada, a tu volumen de inferencia, hace que las API en la nube no salgan a cuenta
    • La privacidad de los usuarios exige que los datos se queden en el dispositivo: ningún dato en bruto del sensor sale de él

    Cuándo no

    • El modelo necesita de verdad más de 70.000 millones de parámetros, y el dispositivo no puede con una versión cuantizada sin perder la precisión que exige el caso de uso
    • La inferencia ocurre como mucho unas pocas veces al día: a esa frecuencia, la nube sale más barata y sencilla
    • No eres dueño del hardware: si se trata de un navegador genérico, la inferencia en el dispositivo se limita a WebAssembly ONNX y normalmente no compensa el esfuerzo

    Proceso

    Semana 1: estudio del hardware y análisis del equilibrio entre precisión y tamaño. Semanas 2–4: cuantización del modelo y primera versión funcionando en el dispositivo. Semanas 5–7: optimización específica de NPU/GPU y benchmarking. Semanas 8–10: estrategia sin conexión y de sincronización, pipeline de entrega OTA, y pruebas de consumo y temperatura.

    Proceso de entrega completo

    Precios

    Precio cerrado según la plataforma y la complejidad del modelo. Adaptación a una sola plataforma: $60–140k. Multiplataforma con entrega OTA: $120–280k. Optimización específica de NPU: $30–60k adicionales por cada chip objetivo. En el discovery te diremos si el modelo puede funcionar de verdad en tu hardware con la precisión que necesitas.

    Ver modelos de colaboración

    Sectores en los que aplicamos este servicio

    Preguntas frecuentes

    ¿Cuánto perjudica la cuantización a la precisión?
    La cuantización INT8 suele costar entre un 0,5 % y un 2 % de precisión en tareas de clasificación. En tareas de detección y generación, el rango es más amplio. Medimos la diferencia real contra tu conjunto de evaluación durante la semana 1: tienes un número, no un rango, antes de que empiece cualquier trabajo de optimización.
    ¿Para qué chips estáis optimizados?
    Apple Neural Engine (series A/M), Qualcomm Hexagon DSP, Arm Ethos NPU, NVIDIA Jetson (TensorRT) y objetivos Intel OpenVINO. Para despliegues en microcontroladores: series STM32, Nordic nRF y ESP32. En el discovery te decimos si tu chip objetivo tiene margen suficiente para el modelo que necesitas.
    ¿Cómo gestionáis las actualizaciones del modelo sin publicar una nueva versión de la app?
    Entrega OTA de los pesos a través de una CDN firmada (solo los pesos, no código), con un mecanismo de rollback y un control de versión que impide publicar un modelo peor que el anterior. Se integra en tu CI actual, de modo que una mejora del modelo dispara un envío OTA igual que una actualización de dependencias dispara una build.
    Un ingeniero de TekPiq en su mesa con una placa embebida, un portátil y un monitor
    Trabajo de firmware e integración en la mesa de hardware.

    Quién lo construye

    Nuestro propio equipo, que trabaja desde nuestra oficina en Istočno Sarajevo, Bosnia y Herzegovina. Los ingenieros de tu llamada para definir el alcance son quienes lo construyen.

    Conoce al equipo

    Edge AI e inferencia embebida: ¿hablamos?

    Llamada de 30 minutos para definir el alcance. Sin compromiso ni presión comercial.