Small Language Models & On-Device-KI

Kompakte, feinabgestimmte Modelle auf Ihrer eigenen Hardware — Frontier-Qualität bei umrissenen Aufgaben zu einem Bruchteil der Kosten, ohne dass Daten das Haus verlassen.

<10mstypische Edge-Latenz
1–8BParameter-Sweet-Spot
100%Daten bleiben im Haus

Warum es wichtig ist

Der Reflex, zum größten verfügbaren Modell zu greifen, ist verständlich, bei einer eng umrissenen Aufgabe aber oft falsch. Ein Modell im Bereich von ein bis acht Milliarden Parametern, auf Ihren eigenen Daten feinabgestimmt und für handelsübliche Hardware quantisiert, erreicht bei der konkreten Aufgabe häufig eine Frontier-API — zu einem Bruchteil der Kosten und ohne dass ein einziges Token Ihr Haus verlässt.

Drei Kräfte machen kleine Modelle gerade jetzt überzeugend: Das Fine-Tuning-Tooling ist gereift, die Quantisierung ist für viele Aufgaben nahezu verlustfrei, und die Hardware — selbst gewöhnliche CPUs und kleine NPUs — hat aufgeholt. Zusammen verschieben sie den Punkt, an dem Self-Hosting die Token-Preise schlägt, weit nach unten.

Bei regulierten Daten geht es gar nicht wirklich um Kosten. Ein Modell auf Ihrer eigenen Hardware sendet niemals einen Kundendatensatz, eine Krankenakte oder eine vertrauliche Information an Dritte. Diese eine Eigenschaft beseitigt eine ganze Kategorie von Compliance- und Anbieterrisiken.

Unser Ansatz

Wir beginnen damit zu beweisen, dass das kleine Modell die Aufgabe wirklich erfüllen kann. Vor jedem längeren Projekt feintunen wir einen Kandidaten auf einem Ausschnitt Ihrer Daten und vergleichen ihn direkt mit dem Frontier-Modell, für das Sie sonst zahlen würden. Schließt es die Lücke nicht, sagen wir es Ihnen — manchmal ist ein Hybrid die richtige Wahl.

Ist der Ansatz bewiesen, bauen wir die vollständige Pipeline: Datenaufbereitung, Fine-Tuning, Quantisierung und Paketierung, alles reproduzierbar. Wir dimensionieren das Modell für Ihre tatsächliche Hardware — Datacenter-GPU, gewöhnliche Server-CPU oder eingebettete NPU.

Am Ende besitzen Sie alles — Gewichte, Trainingscode und Dokumentation — ohne Abhängigkeit von unserer Infrastruktur.

Wo es passt

On-Device-Assistenten

Assistenten, die vollständig auf Telefon, Laptop oder eingebettetem Gerät laufen — ohne Netzwerk und ohne dass Daten die Hardware verlassen.

Dokumentklassifizierung

Offline-Klassifizierung und -Extraktion sensibler Dokumente, wenn das Senden an eine externe API keine Option ist.

Latenzarmes Verfassen

Autocomplete, Verfassen und Umschreiben, das sich sofort anfühlt, weil die Inferenz lokal läuft.

Private Zusammenfassung

Zusammenfassen medizinischer, rechtlicher oder finanzieller Unterlagen in Ihrer eigenen Umgebung.

Industrie & IoT

Kompakte Modelle in Feldgeräten, Maschinen und IoT-Hardware, die ohne Konnektivität funktionieren müssen.

Routing bei hohem Volumen

Kostenkontrollierte Triage und Routing bei Volumina, bei denen Token-Preise untragbar wären.

Unser Vorgehen

1

Umfang

Wir erfassen die genaue Aufgabe, das Latenzziel und das Hardware-Budget und definieren „gut genug" in Zahlen.

2

Daten

Wir sammeln und bereinigen die Domänendaten und legen ein faires Evaluierungs-Hold-out beiseite.

3

Entwurf

Wir wählen eine Basis-Modellfamilie und entwerfen die Fine-Tuning- und Quantisierungsstrategie.

4

Umsetzung

Wir feintunen, quantisieren und paketieren das Modell für Ihre Zielhardware mit reproduzierbarer Pipeline.

5

Bewertung

Wir benchmarken Genauigkeit, Latenz und Kosten ehrlich gegen Ziel und Frontier-Baseline.

6

Auslieferung

Wir übergeben Gewichte, Pipeline und Dokumentation und begleiten den Produktions-Rollout.

Eingesetzte Technik

Wir arbeiten mit offenen Modellfamilien und Tools, die Portabilität und Kontrolle bieten — passend zu Aufgabe und Hardware, nicht zu einem Hausfavoriten.

Llama / Mistral / PhiLoRA & QLoRA fine-tuningGGUF / llama.cppvLLM servingONNX RuntimeQuantization (INT4/INT8)OllamaHardware-aware distillation

Was Sie erhalten

FAQ

Bei einer eng umrissenen Aufgabe erreicht ein feinabgestimmtes kleines Modell häufig ein großes Allzweckmodell. Wir benchmarken beide an Ihren Daten, damit die Entscheidung auf Zahlen beruht.

Ja. Quantisierte Modelle laufen gut auf modernen CPUs und NPUs. Wir dimensionieren das Modell für Ihr Hardware-Budget.

Sie besitzen Gewichte und Pipeline vollständig. Kein Lock-in, und Sie können jederzeit neu trainieren.

Ein funktionierender Prototyp, gegen eine Frontier-Baseline gebenchmarkt, liegt meist in zwei bis vier Wochen vor.

Dann sagen wir es. Oft ist ein Hybrid richtig, der den Normalfall lokal löst und den schweren Rest an ein größeres Modell weiterleitet.

Verwandte Leistungen

Sprechen Sie mit uns darüber

Buchen Sie ein 30-minütiges Gespräch. Wir sagen Ihnen ehrlich, ob wir helfen können.

Termin buchen