← Åsmund Bakkevig

Referatmaskinen

Iblant når jeg er ute og går, eller gjør et eller annet praktisk, dukker det opp noen ideer som jeg synes det er verdt å ta vare på. Da snakker jeg inn et opptak på telefonen. Innen en time ligger det et referat og eventuelt en oppgaveliste på alle enhetene mine. Talegjenkjenningen skjer på en gammel bærbar PC hjemme, ikke hos en nettjeneste. Her forklarer jeg hvordan det virker, og hvor grensene går.

Talegjenkjenning NB-Whisper fra Nasjonalbiblioteket Maskin Bærbar fra 2015 · 7 GB minne · uten skjermkort Kjører Hver time, siden august 2026 Resultat Referat og oppgaveliste på alle enheter

Veien et opptak tar

HJEMMESERVEREN — ALT HER INNE SKJER HJEMME Opptak Taleopptak · iPhone snarvei Mappa «Transkriber» synkes med alle enheter sjekkes hver time Tale blir til tekst NB-Whisper, på maskinen lydfila Lydarkiv utenfor synken hele teksten Transkripsjoner på alle enheter bare teksten forlater huset Claude skriver referatet referatet kommer tilbake Referater på alle enheter
Alt innenfor den stiplede rammen skjer på maskinen hjemme. Bare én ting går ut av huset: den ferdige teksten, som sendes til Claude for å bli oppsummert. Lyden gjør det aldri.
  1. Jeg spiller inn et lydopptak i «Taleopptak» på iPhone.
  2. Ved hjelp av en snarvei på telefonen sender jeg opptaket til mappa «Transkriber» på hjemmeserveren.
  3. Én gang i timen ser serveren etter nye opptak og gjør talen om til tekst.
  4. Teksten sendes til Claude, som skriver et referat og en oppgaveliste.
  5. Referatet og hele teksten legges i hjemmeskyen og dukker opp på alle enhetene. Jeg får et varsel på Telegram.
  6. Lydfila flyttes til et arkiv på serveren.

En gammel maskin kan kjøre KI

Serveren er en Toshiba-bærbar fra 2015, med 7 GB minne og uten skjermkort. Talegjenkjenning bruker vanligvis kraftigere maskiner, gjerne med et kraftig skjermkort.

Likevel kjører den en ganske stor utgave av NB-Whisper. Det går fordi modellen er komprimert: tallene den består av lagres i et enklere format. Da bruker den mye mindre minne, og kvaliteten blir nesten like god.

Et langt opptak tar en god stund å transkribere, men det gjør ikke så mye, for jobben går uansett i bakgrunnen.

Hvorfor en norsk modell

NB-Whisper er Nasjonalbibliotekets utgave av Whisper, en talegjenkjenner fra OpenAI, trent videre på norsk tale. Den er spesielt god på norske dialekter, trykk og norske navn. Gøy å prøve noe norskutviklet, og spesielt gøy at det kan kjøres lokalt.

Den klarer likevel ikke absolutt alt, særlig for en som opererer i en virkelighet som ofte er engelsk.

Engelske fagord blir hørt som norske ord

Når jeg snakker norsk og plutselig sier «cron-jobb» eller «Anthropic», har modellen ingen grunn til å tro at det kommer et engelsk ord. Den gjetter på noe som høres norsk ut:

«crownie»cron-jobb
«Choppicks»Anthropic
«HIQ»Haiku

Modellen kan få en ordliste med ord den skal være ekstra oppmerksom på.

Ordlisten har i skrivende stund 17 ord og navn, blant annet Obsidian, Syncthing og Karpathy. Inntil videre må jeg legge til ting mer eller mindre manuelt, men det skal jeg løse etter hvert.

Lyden skal ikke hope seg opp på telefonen

Et taleopptak tar mye plass. Teksten fra det samme opptaket tar nesten ingen. Hvis lydfilene ble liggende på telefonen, ville telefonen fylles opp av opptak jeg allerede er ferdig med. Derfor sendes taleopptakene til hjemmeserveren med en gang. Teksten har jeg tilgang til på alle enheter via Samba og Syncthing — se detaljer om dette i posten om Hjemmeskyen.

Ikke bare transkripsjon

For hvert opptak kommer det to tekstfiler (.md) som jeg vanligvis åpner i notatprogrammet Obsidian: hele transkripsjonen, og et referat. Øverst i begge står dato, hvor langt opptaket var, og hvilken lydfil de kom fra. Referatet ser slik ut:

## Referat Alle temaene som kom opp, også sidesporene. ## Oppgaver ### Meg Det jeg må gjøre selv. ### AI Det en KI-assistent kan gjøre for meg.

Oppgavelisten er delt i to med vilje. Meg er det jeg må gjøre selv. AI er det jeg kan be en KI-assistent om å gjøre. Da ser jeg med én gang hva som venter på meg, og hva jeg kan overlate til andre. Det skal sies at dette ikke er helt feilfritt, og at en del av de løse tankene mine ikke blir gjort så mye med …

Når referatet er klart, får jeg et varsel på Telegram via Claude Code-boten jeg har satt opp. Ved eventuelle feil får jeg også beskjed om det.

Der det ikke er privat

Lyden forlater aldri mitt private nettverk, men teksten gjør det. Referatet skrives av Claude, en språkmodell fra Anthropic som kjører på deres servere. Det er den ene pila som går ut av rammen i diagrammet. Dersom jeg bare ville hatt transkripsjon, kunne jeg fått det privat, men en språkmodell som skriver gode referater på norsk, trenger mer kraft enn det min gamle Toshiba leverer.

Dette er det svakeste punktet i oppsettet ut fra et personvernperspektiv. En dag skal jeg få tak i en maskin med mer minne og et skjermkort, eller en Mac Studio, og så kan jeg kjøre lokale LLM-er i stedet for å sende dataene til amerikanske skyer.

Begrensninger