Edge AI & Embedded Inferenz – KI, die läuft, wenn die Cloud ausfällt
Cloud-KI-Inferenz kostet $0.002 pro Aufruf, fügt 200ms Latenz hinzu und fällt aus, sobald die Verbindung abbricht. Für IoT-Geräte, Systeme auf der Fabrikhalle und mobile Apps, die Echtzeit-KI brauchen, ist On-Device-Inferenz kein Nice-to-have – es ist die Architektur.
| Dimension | Cloud-Inferenz API-Aufruf pro Anfrage | Edge-Inferenz Auf dem Gerät, ohne Netzwerk |
|---|---|---|
| Latenz | 150–400ms (Roundtrip) | 5–50ms auf dem Gerät |
| Funktioniert offline | ||
| Kosten im großen Maßstab | $0.002+ pro Aufruf | Hardware amortisiert |
| Datenschutz | Daten verlassen das Gerät | Nichts verlässt das Gerät |
| Modell-Updates | Sofort (serverseitig) | OTA-Pipeline nötig |
| Passend für | Seltene Aufrufe, große Modelle | Echtzeit, Always-on, IoT |
Was Sie bekommen
Wann es passt
- Eine Inferenzlatenz unter 50ms ist eine Produktanforderung – Cloud-Roundtrips schaffen das nicht
- Das Gerät ist zeitweise oder nie verbunden (Industrie, ländliche Gebiete, Fahrzeuge, Wearables)
- Die Kosten pro Aufruf machen Cloud-APIs bei Ihrem Inferenzvolumen zur falschen Unit Economics
- Der Datenschutz verlangt, dass Daten auf dem Gerät bleiben – keine rohen Sensordaten verlassen das Gerät
Wann nicht
- Das Modell braucht wirklich 70+ Milliarden Parameter, und das Gerät kann keine quantisierte Version tragen, ohne die benötigte Genauigkeit zu verlieren
- Inferenz findet höchstens ein paar Mal am Tag statt – bei dieser Frequenz ist die Cloud günstiger und einfacher
- Sie besitzen die Hardware nicht – bei einem generischen Browser ist On-Device-Inferenz auf WebAssembly-ONNX beschränkt und meist den Aufwand nicht wert
Ablauf
Woche 1: Hardware-Analyse und Abwägung zwischen Genauigkeit und Modellgröße. Wochen 2–4: Modellquantisierung und erste On-Device-Portierung. Wochen 5–7: hardwarespezifische NPU-/GPU-Optimierung und Benchmarking. Wochen 8–10: Offline-/Sync-Strategie, OTA-Auslieferungspipeline, Strom- und Temperaturtests.
Der vollständige AblaufPreise
Festpreis nach Plattform und Modellkomplexität. Portierung auf eine Plattform: $60–140k. Mehrere Plattformen mit OTA-Auslieferung: $120–280k. Hardwarespezifische NPU-Optimierung: zusätzlich $30–60k pro Chip-Ziel. Wir sagen Ihnen in der Discovery, ob das Modell auf Ihrer Hardware mit der benötigten Genauigkeit überhaupt laufen kann.
Zusammenarbeitsmodelle ansehenSo würden wir es bauen
Blueprints: Beispielprojekte mit Plan, Architektur und den Zielgrößen, von denen wir ausgehen würden.
Branchen, in denen wir das umsetzen
FAQ
- Wie stark schadet Quantisierung der Genauigkeit?
- INT8-Quantisierung kostet bei Klassifikationsaufgaben typischerweise 0,5–2% Genauigkeit. Bei Detektions- und Generierungsaufgaben ist die Spanne größer. Wir messen die tatsächliche Abweichung gegen Ihr Eval-Set bereits in Woche 1 – Sie erhalten eine konkrete Zahl, keine Spanne, bevor überhaupt Optimierungsarbeit beginnt.
- Für welche Chips sind Sie optimiert?
- Apple Neural Engine (A-/M-Serie), Qualcomm Hexagon DSP, Arm Ethos NPU, NVIDIA Jetson (TensorRT) und Intel-OpenVINO-Ziele. Für Mikrocontroller-Deployments: STM32, Nordic nRF und die ESP32-Serie. Wir sagen Ihnen in der Discovery, ob Ihr Ziel-Chip genug Spielraum für das benötigte Modell hat.
- Wie handhaben Sie Modell-Updates ohne App-Release?
- OTA-Auslieferung der Gewichte über ein signiertes CDN (nur Gewichte, kein Code) mit Rollback-Mechanismus und einer Versionsschranke, die verhindert, dass ein verschlechtertes Modell ausgeliefert wird. Eingebunden in Ihre bestehende CI, sodass eine Modellverbesserung einen OTA-Push auslöst, genau wie ein Dependency-Update einen Build auslöst.

Wer es baut
Unser eigenes Team arbeitet aus unserem Büro in Istočno Sarajevo, Bosnien und Herzegowina. Die Engineers in Ihrem Erstgespräch sind dieselben, die es später auch bauen.
Das Team kennenlernen