Små språkmodeller & AI på enheten

Kompakte, finjusterte modeller på din egen maskinvare — frontier-kvalitet på avgrensede oppgaver til en brøkdel av kostnaden, uten at data forlater huset.

<10mstypisk kant-latens
1–8Bparameter-sweet-spot
100%data forblir internt

Hvorfor det betyr noe

Refleksen om å gripe etter den største tilgjengelige modellen er forståelig, men på en avgrenset oppgave ofte feil. En modell i området én til åtte milliarder parametere, finjustert på dine egne data og kvantisert for vanlig maskinvare, matcher ofte en frontier-API på nettopp den jobben du bryr deg om — til en brøkdel av kostnaden og med hvert token innenfor dine egne vegger.

Tre krefter gjør små modeller overbevisende akkurat nå: finjusteringsverktøyene har modnet, kvantisering er nesten tapsfri for mange oppgaver, og maskinvaren — selv vanlige CPU-er og små NPU-er — har tatt igjen. Sammen flytter de punktet der selvhosting slår token-priser, langt ned.

For regulerte data handler det egentlig ikke om kostnad. En modell som kjører på din egen maskinvare, sender aldri en kundeoppføring, et journalnotat eller privilegert informasjon til en tredjepart. Denne ene egenskapen fjerner en hel kategori av samsvars- og leverandørrisiko.

Slik griper vi det an

Vi starter med å bevise at den lille modellen faktisk kan gjøre jobben. Før et langt oppdrag finjusterer vi en kandidat på en del av dataene dine og benchmarker den direkte mot frontier-modellen du ellers ville betalt for. Klarer den ikke å tette gapet, sier vi ifra — noen ganger er en hybrid det riktige valget.

Når tilnærmingen er bevist, bygger vi hele pipelinen: dataforberedelse, finjustering, kvantisering og pakking, alt reproduserbart. Vi dimensjonerer modellen for din faktiske maskinvare — datasenter-GPU, vanlig server-CPU eller innebygd NPU.

Du sitter igjen med å eie alt — vekter, treningskode og dokumentasjon — uten avhengighet av vår infrastruktur.

Hvor det passer

Assistenter på enheten

Assistenter som kjører helt på telefon, laptop eller innebygd enhet, uten nettverk og uten at data forlater maskinvaren.

Dokumentklassifisering

Frakoblet klassifisering og uttrekk over sensitive dokumenter, når sending til et eksternt API ikke er et alternativ.

Lavlatens-skriving

Autofullføring og skriving som føles umiddelbar fordi inferens skjer lokalt.

Privat oppsummering

Oppsummering av medisinske, juridiske eller finansielle poster i ditt eget miljø.

Industri & IoT

Kompakte modeller innebygd i feltenheter, maskineri og IoT-maskinvare som må virke uten tilkobling.

Ruting ved høyt volum

Kostnadskontrollert triage og ruting ved volumer der token-priser ville vært uholdbare.

Vår prosess

1

Omfang

Vi kartlegger oppgaven, latensmålet og maskinvarebudsjettet og definerer «godt nok» i tall.

2

Data

Vi samler og renser domenedataene og setter av et rettferdig evalueringssett.

3

Design

Vi velger en basismodellfamilie og designer finjusterings- og kvantiseringsstrategien.

4

Bygging

Vi finjusterer, kvantiserer og pakker modellen for din målmaskinvare med en reproduserbar pipeline.

5

Evaluering

Vi benchmarker nøyaktighet, latens og kostnad ærlig mot målet og en frontier-baseline.

6

Levering

Vi overleverer vekter, pipeline og dokumentasjon og støtter produksjonsutrullingen.

Teknologi vi bruker

Vi jobber med åpne modellfamilier og verktøy som gir portabilitet og kontroll, valgt for oppgaven og maskinvaren din.

Llama / Mistral / PhiLoRA & QLoRA fine-tuningGGUF / llama.cppvLLM servingONNX RuntimeQuantization (INT4/INT8)OllamaHardware-aware distillation

Hva du får

FAQ

På en avgrenset oppgave matcher en finjustert liten modell ofte en stor generell modell. Vi benchmarker begge mot dataene dine, så beslutningen hviler på tall.

Ja. Kvantiserte modeller kjører godt på moderne CPU-er og NPU-er. Vi dimensjonerer modellen for maskinvarebudsjettet ditt.

Du eier vektene og pipelinen fullt ut. Ingen innlåsing, og du kan trene på nytt når dataene endres.

En fungerende prototype, benchmarket mot en frontier-baseline, foreligger vanligvis på to til fire uker.

Da sier vi ifra. Ofte er svaret en hybrid som håndterer normaltilfellet lokalt og ruter den vanskelige halen til en større modell.

Relaterte tjenester

Snakk med oss om dette

Bestill en 30-minutters samtale. Vi sier ærlig om vi kan hjelpe.

Bestill samtale