Hoppa till huvudinnehållet
    Edge AI och inbyggd inferens

    Edge AI och inbyggd inferens – AI som fungerar utan molnet

    AI-inferens i molnet kostar $0.002 per anrop, lägger till 200ms latens och slutar fungera i samma sekund som uppkopplingen bryts. För IoT-enheter, system på fabriksgolvet och mobilappar som behöver AI i realtid är inferens på enheten inte bara trevligt att ha – det är själva arkitekturen.

    Molninferens jämfört med edge-inferens
    Dimension
    Molninferens
    Ett API-anrop per förfrågan
    Edge-inferens
    På enheten, inget nätverk
    Latens150–400ms (tur och retur)5–50ms på enheten
    Fungerar offline
    Kostnad i skala$0.002+ per anropHårdvaran avskrivs över tid
    DataintegritetData lämnar enhetenInget lämnar enheten
    ModelluppdateringarDirekt (serversidan)Kräver en OTA-pipeline
    Rätt val förLåg frekvens, stora modellerRealtid, alltid på, IoT
    De flesta produktionssystem kombinerar båda – edge för latenskritiska flöden, molnet för de tunga lyften.

    Det här får du

    Pipeline för kvantisering och komprimering av modeller – INT8/FP16-kvantisering, pruning och destillering anpassat efter din hårdvara, utan att offra den träffsäkerhet du faktiskt behöver
    Runtime på enheten för iOS (Core ML, BNNS), Android (NNAPI, TFLite, MediaPipe), inbyggd Linux (ONNX Runtime, TensorRT, OpenVINO) och MCU:er (TensorFlow Lite Micro, CMSIS-NN)
    Offline-inferens med molnsynk – kontrollerad nedgradering när uppkopplingen bryts, synk när den återkommer, med en tydligt definierad konsistensmodell
    Hårdvaruspecifik optimering för NPU:er, GPU:er och DSP:er – Apple Neural Engine, Qualcomm Hexagon, Arm Ethos, NVIDIA Jetson
    Prestandatester: latens (p50/p95), genomströmning, strömförbrukning och värmeutveckling på din riktiga hårdvara – inte simulatorkörningar
    En pipeline för kontinuerlig modelleverans – OTA-uppdateringar av modellvikter utan att kräva ett nytt appbutiksrelease

    När det passar

    • Inferenslatens under 50ms är ett produktkrav – en tur och retur till molnet klarar inte det
    • Enheten är tidvis eller aldrig uppkopplad (industri, glesbygd, fordon, wearables)
    • Kostnaden per anrop i din volym gör moln-API:er till fel enhetsekonomi
    • Användarnas integritet kräver att data stannar på enheten – ingen rå sensordata lämnar den

    När det inte passar

    • Modellen kräver verkligen 70B+ parametrar och enheten klarar inte en kvantiserad version utan att förlora den träffsäkerhet användningsfallet kräver
    • Inferens sker som mest ett par gånger om dagen – molnet är billigare och enklare vid den frekvensen
    • Du äger inte hårdvaran – rör det sig om en vanlig webbläsare är inferens på enheten begränsat till WebAssembly ONNX och sällan värt insatsen

    Process

    Vecka 1: genomgång av hårdvaran och avvägning mellan träffsäkerhet och modellstorlek. Vecka 2–4: kvantisering av modellen och en första portning till enheten. Vecka 5–7: hårdvaruspecifik NPU/GPU-optimering och prestandatester. Vecka 8–10: strategi för offline och synk, leveranspipeline för OTA samt tester av strömförbrukning och värmeutveckling.

    Hela leveransprocessen

    Prissättning

    Fast pris efter plattform och modellkomplexitet. Portning till en plattform: $60–140k. Flera plattformar med OTA-leverans: $120–280k. Hårdvaruspecifik NPU-optimering: lägg till $30–60k per chip. Vi säger redan i discoveryfasen om modellen faktiskt kan köras på din hårdvara med den träffsäkerhet du behöver.

    Se våra samarbetsformer

    Branscher där vi erbjuder det här

    Vanliga frågor

    Hur mycket försämrar kvantisering träffsäkerheten?
    INT8-kvantisering kostar normalt 0.5–2% träffsäkerhet på klassificeringsuppgifter. För detektering och generering är spannet bredare. Vi mäter den faktiska skillnaden mot din egen utvärderingsdata redan vecka 1 – du får en siffra, inte ett spann, innan något optimeringsarbete börjar.
    Vilka chip optimerar ni för?
    Apple Neural Engine (A/M-serien), Qualcomm Hexagon DSP, Arm Ethos NPU, NVIDIA Jetson (TensorRT) och Intel OpenVINO. För MCU-driftsättningar: STM32, Nordic nRF och ESP32-serien. Vi säger redan i discoveryfasen om ditt chip har tillräcklig marginal för den modell du behöver.
    Hur hanterar ni modelluppdateringar utan ett nytt appsläpp?
    OTA-leverans av vikter via en signerad CDN (bara vikter, ingen kod) med en rollback-mekanism och en versionsspärr som hindrar en försämrad modell från att gå live. Kopplat till din befintliga CI, så att en modellförbättring utlöser en OTA-push på samma sätt som en beroendeuppdatering utlöser ett bygge.
    En utvecklare på TekPiq vid ett skrivbord med ett styrkort, en laptop och en skärm
    Firmware- och integrationsarbete vid hårdvarubordet.

    Vem som bygger det

    Vårt eget team, som arbetar från vårt kontor i Istočno Sarajevo, Bosnien och Hercegovina. Ingenjörerna på ditt behovssamtal är samma personer som bygger det.

    Möt teamet

    Edge AI och inbyggd inferens – ska vi prata?

    Ett 30 minuters behovssamtal. Förutsättningslöst och utan säljtryck.