Edge AI och inbyggd inferens – AI som fungerar utan molnet
AI-inferens i molnet kostar $0.002 per anrop, lägger till 200ms latens och slutar fungera i samma sekund som uppkopplingen bryts. För IoT-enheter, system på fabriksgolvet och mobilappar som behöver AI i realtid är inferens på enheten inte bara trevligt att ha – det är själva arkitekturen.
| Dimension | Molninferens Ett API-anrop per förfrågan | Edge-inferens På enheten, inget nätverk |
|---|---|---|
| Latens | 150–400ms (tur och retur) | 5–50ms på enheten |
| Fungerar offline | ||
| Kostnad i skala | $0.002+ per anrop | Hårdvaran avskrivs över tid |
| Dataintegritet | Data lämnar enheten | Inget lämnar enheten |
| Modelluppdateringar | Direkt (serversidan) | Kräver en OTA-pipeline |
| Rätt val för | Låg frekvens, stora modeller | Realtid, alltid på, IoT |
Det här får du
När det passar
- Inferenslatens under 50ms är ett produktkrav – en tur och retur till molnet klarar inte det
- Enheten är tidvis eller aldrig uppkopplad (industri, glesbygd, fordon, wearables)
- Kostnaden per anrop i din volym gör moln-API:er till fel enhetsekonomi
- Användarnas integritet kräver att data stannar på enheten – ingen rå sensordata lämnar den
När det inte passar
- Modellen kräver verkligen 70B+ parametrar och enheten klarar inte en kvantiserad version utan att förlora den träffsäkerhet användningsfallet kräver
- Inferens sker som mest ett par gånger om dagen – molnet är billigare och enklare vid den frekvensen
- Du äger inte hårdvaran – rör det sig om en vanlig webbläsare är inferens på enheten begränsat till WebAssembly ONNX och sällan värt insatsen
Process
Vecka 1: genomgång av hårdvaran och avvägning mellan träffsäkerhet och modellstorlek. Vecka 2–4: kvantisering av modellen och en första portning till enheten. Vecka 5–7: hårdvaruspecifik NPU/GPU-optimering och prestandatester. Vecka 8–10: strategi för offline och synk, leveranspipeline för OTA samt tester av strömförbrukning och värmeutveckling.
Hela leveransprocessenPrissättning
Fast pris efter plattform och modellkomplexitet. Portning till en plattform: $60–140k. Flera plattformar med OTA-leverans: $120–280k. Hårdvaruspecifik NPU-optimering: lägg till $30–60k per chip. Vi säger redan i discoveryfasen om modellen faktiskt kan köras på din hårdvara med den träffsäkerhet du behöver.
Se våra samarbetsformerSå skulle vi bygga det
Blueprints: exempelprojekt med planen, arkitekturen och målen vi skulle utgå från.
Branscher där vi erbjuder det här
Vanliga frågor
- Hur mycket försämrar kvantisering träffsäkerheten?
- INT8-kvantisering kostar normalt 0.5–2% träffsäkerhet på klassificeringsuppgifter. För detektering och generering är spannet bredare. Vi mäter den faktiska skillnaden mot din egen utvärderingsdata redan vecka 1 – du får en siffra, inte ett spann, innan något optimeringsarbete börjar.
- Vilka chip optimerar ni för?
- Apple Neural Engine (A/M-serien), Qualcomm Hexagon DSP, Arm Ethos NPU, NVIDIA Jetson (TensorRT) och Intel OpenVINO. För MCU-driftsättningar: STM32, Nordic nRF och ESP32-serien. Vi säger redan i discoveryfasen om ditt chip har tillräcklig marginal för den modell du behöver.
- Hur hanterar ni modelluppdateringar utan ett nytt appsläpp?
- OTA-leverans av vikter via en signerad CDN (bara vikter, ingen kod) med en rollback-mekanism och en versionsspärr som hindrar en försämrad modell från att gå live. Kopplat till din befintliga CI, så att en modellförbättring utlöser en OTA-push på samma sätt som en beroendeuppdatering utlöser ett bygge.

Vem som bygger det
Vårt eget team, som arbetar från vårt kontor i Istočno Sarajevo, Bosnien och Hercegovina. Ingenjörerna på ditt behovssamtal är samma personer som bygger det.
Möt teamet