Edge AI e inferencia embebida: IA que funciona sin conexión a la nube
La inferencia de IA en la nube cuesta $0.002 por llamada, añade 200 ms de latencia y falla en cuanto se cae la conectividad. Para dispositivos IoT, sistemas de planta y apps móviles que necesitan IA en tiempo real, la inferencia en el dispositivo no es un capricho: es la arquitectura correcta.
| Dimensión | Inferencia en la nube Una llamada a la API por petición | Inferencia en el edge En el dispositivo, sin red |
|---|---|---|
| Latencia | 150–400 ms (ida y vuelta) | 5–50 ms en el dispositivo |
| Funciona sin conexión | ||
| Coste a escala | $0.002+ por llamada | Hardware amortizado |
| Privacidad de los datos | Los datos salen del dispositivo | Nada sale del dispositivo |
| Actualizaciones del modelo | Instantáneas (del lado del servidor) | Requieren un pipeline OTA |
| Recomendado para | Modelos grandes y de baja frecuencia | Tiempo real, siempre activo, IoT |
Qué obtienes
Cuándo encaja
- Una latencia de inferencia por debajo de 50 ms es un requisito de producto que un viaje de ida y vuelta a la nube no puede cumplir
- El dispositivo tiene conectividad intermitente o nula (industrial, rural, en vehículos, wearables)
- El coste por llamada, a tu volumen de inferencia, hace que las API en la nube no salgan a cuenta
- La privacidad de los usuarios exige que los datos se queden en el dispositivo: ningún dato en bruto del sensor sale de él
Cuándo no
- El modelo necesita de verdad más de 70.000 millones de parámetros, y el dispositivo no puede con una versión cuantizada sin perder la precisión que exige el caso de uso
- La inferencia ocurre como mucho unas pocas veces al día: a esa frecuencia, la nube sale más barata y sencilla
- No eres dueño del hardware: si se trata de un navegador genérico, la inferencia en el dispositivo se limita a WebAssembly ONNX y normalmente no compensa el esfuerzo
Proceso
Semana 1: estudio del hardware y análisis del equilibrio entre precisión y tamaño. Semanas 2–4: cuantización del modelo y primera versión funcionando en el dispositivo. Semanas 5–7: optimización específica de NPU/GPU y benchmarking. Semanas 8–10: estrategia sin conexión y de sincronización, pipeline de entrega OTA, y pruebas de consumo y temperatura.
Proceso de entrega completoPrecios
Precio cerrado según la plataforma y la complejidad del modelo. Adaptación a una sola plataforma: $60–140k. Multiplataforma con entrega OTA: $120–280k. Optimización específica de NPU: $30–60k adicionales por cada chip objetivo. En el discovery te diremos si el modelo puede funcionar de verdad en tu hardware con la precisión que necesitas.
Ver modelos de colaboraciónCómo lo construiríamos
Blueprints: proyectos de ejemplo con el plan, la arquitectura y los objetivos de los que partiríamos.
Sectores en los que aplicamos este servicio
Preguntas frecuentes
- ¿Cuánto perjudica la cuantización a la precisión?
- La cuantización INT8 suele costar entre un 0,5 % y un 2 % de precisión en tareas de clasificación. En tareas de detección y generación, el rango es más amplio. Medimos la diferencia real contra tu conjunto de evaluación durante la semana 1: tienes un número, no un rango, antes de que empiece cualquier trabajo de optimización.
- ¿Para qué chips estáis optimizados?
- Apple Neural Engine (series A/M), Qualcomm Hexagon DSP, Arm Ethos NPU, NVIDIA Jetson (TensorRT) y objetivos Intel OpenVINO. Para despliegues en microcontroladores: series STM32, Nordic nRF y ESP32. En el discovery te decimos si tu chip objetivo tiene margen suficiente para el modelo que necesitas.
- ¿Cómo gestionáis las actualizaciones del modelo sin publicar una nueva versión de la app?
- Entrega OTA de los pesos a través de una CDN firmada (solo los pesos, no código), con un mecanismo de rollback y un control de versión que impide publicar un modelo peor que el anterior. Se integra en tu CI actual, de modo que una mejora del modelo dispara un envío OTA igual que una actualización de dependencias dispara una build.

Quién lo construye
Nuestro propio equipo, que trabaja desde nuestra oficina en Istočno Sarajevo, Bosnia y Herzegovina. Los ingenieros de tu llamada para definir el alcance son quienes lo construyen.
Conoce al equipo