Uncategorized

Kør dine egne sprogmodeller lokalt på Ubuntu uden datalækager

Tag kontrollen over dine data tilbage på dit eget skrivebord

Cloudbaserede sprogmodeller er blevet en genvej til alt fra tekstbearbejdning og kodehjælp til analyse af interne dokumenter. Men genvejen har en pris. Når medarbejdere kopierer kontrakter, kundemails, kildekode eller personoplysninger ind i en lukket tjeneste, kan det være vanskeligt at vide, hvor data behandles, hvor længe de gemmes, og hvem der i sidste ende kan få adgang. Denne form for skygge-AI kan opstå stille og roligt, uden at IT-afdelingen har overblik over modeller, konti eller tidligere delinger.

Et oplagt alternativ er at køre åbne sprogmodeller lokalt på Ubuntu. Med Ollama kan en kompatibel model hentes og afvikles direkte på en stationær computer eller intern server, mens dokumenterne bliver på det lokale system. Det giver større frihed, ingen faste cloud-abonnementer og et mere overskueligt grundlag for sikker intern vidensdeling med lokal AI. Løsningen kræver stadig ansvarlig adgangsstyring og vedligeholdelse, men selve databehandlingen behøver ikke at forlade organisationens netværk.

Ubuntu-terminal med systemoplysninger vist på en mørk computerskærm
Med lokal AI på Ubuntu kan organisationen selv styre, hvor modellerne kører, og hvordan følsomme data behandles.

Hvorfor lokal datasuverænitet trumfer lukkede cloud-tjenester

Den største risiko ved ukontrolleret brug af eksterne LLM-tjenester er ikke selve tekstgenereringen, men informationsstrømmen omkring den. En medarbejder kan sende en kundesag til en personlig konto, en udvikler kan indsætte proprietær kode i en chatbot, eller en HR-medarbejder kan uploade et dokument med følsomme oplysninger. Organisationen mister dermed hurtigt overblikket over behandlingsgrundlag, dataplacering, logning og sletning. Det er netop de typer af risici, som en rapport om privatlivsrisici ved LLM’er gennemgår, selv om rapporten understreger, at den er udarbejdet af eksterne eksperter og ikke udgør en officiel EDPB-position.

Lokal inference, altså generering af svar på den computer, hvor modellen kører, ændrer grundlæggende denne situation. Når netværksadgangen er begrænset eller helt fjernet, sendes prompten ikke til en ekstern modeludbyder. Det gør offlinearbejde muligt og giver en mere direkte kontrol over logfiler, sikkerhedskopier og adgang. Samtidig forsvinder de løbende abonnementsudgifter. Der kan stadig være omkostninger til hardware, strøm, administration og modeltilpasning, men udgiften bliver forudsigelig og uafhængig af antal brugere eller månedlige cloud-kvoter.

Område Lukket cloud-model Lokal model på Ubuntu
Dataplacering Ekstern tjeneste, ofte med komplekse vilkår Eget hardware eller egen intern server
Forbindelse Typisk afhængig af internet Kan fungere offline efter download
Omkostninger Abonnement, forbrug eller brugerlicenser Hardware, strøm og administration
Kontrol Begrænset indsigt i drift og ændringer Kontrol over modeller, adgang og opdateringer
Ydeevne Ofte stærk infrastruktur og hurtige modeller Afhænger af lokal CPU, RAM og GPU

Lokal drift er dog ikke automatisk det samme som fuld sikkerhed. En ubeskyttet Ubuntu-maskine kan stadig kompromitteres, og en model kan generere fejl, forældede oplysninger eller utilsigtet afsløre tekst fra en lokal kontekst. Derfor bør datasuverænitet kombineres med krypterede diske, stærke brugerkonti, opdateringer, netværkssegmentering og klare regler for, hvilke dokumenter der må behandles. Fordelen er, at disse beslutninger kan træffes af organisationen selv i stedet for at være skjult i en ekstern tjenestes standardindstillinger.

Forbered dit Ubuntu-miljø til ubesværet AI-drift

Hardwarebehovet afhænger først og fremmest af modellens størrelse og kvantisering. En mindre model på omkring 7 milliarder parametre kan ofte køre på en moderne CPU med 16 GB RAM, men svaret bliver typisk langsommere end med GPU-acceleration. En maskine med 32 GB RAM, hurtig SSD og en GPU som eksempelvis RTX 4060 giver bedre luft til større modeller og flere samtidige opgaver. Modelfiler kan fylde fra få gigabyte til langt over 100 GB, så lagerplads bør planlægges fra begyndelsen.

  • RAM: 16 GB er et praktisk minimum for mindre modeller, mens 32 GB eller mere giver bedre fleksibilitet.
  • CPU: En nyere flerkernet processor kan håndtere mindre modeller uden GPU.
  • GPU: GPU-acceleration kan forbedre hastigheden betydeligt, hvis model, drivere og Ollama-opsætning understøtter det.
  • Lager: Brug en SSD med god fri plads til modeller, cache, logfiler og eventuelle dokumentindekser.
  • Netværk: Internet er nødvendigt ved første download, men ikke nødvendigvis under selve genereringen.

Ubuntu er et stabilt fundament, fordi systemet giver adgang til et modent Linux-økosystem, automatisering via terminalen og gode muligheder for isolation med brugere, systemtjenester og containere. Før installation bør systemet opdateres, og det er en god idé at afklare, om modellen skal køre på en personlig arbejdsstation, en dedikeret intern server eller en container. En enkel forberedelse kan være at køre sudo apt update og sudo apt upgrade, kontrollere diskplads med df -h og undersøge hukommelsen med free -h. Hvis en GPU skal anvendes, bør den tilhørende driver være installeret og testet separat.

Installér og kør sprogmodeller med Ollama trin for trin

Ollama fungerer som et praktisk lag mellem operativsystemet og de lokale modeller. Værktøjet håndterer modeldownloads, start af runtime og en lokal API, så både terminalværktøjer og grafiske brugerflader kan kobles på. Den officielle Ollama-quickstart beskriver installation på Linux og de første skridt til at starte en chat. Brug altid den officielle vejledning, når installationskommandoer ændrer sig over tid.

  1. Installér Ollama: Åbn Ubuntu-terminalen, og kør den aktuelle installationskommando fra Ollamas officielle dokumentation. Kommandoen henter og installerer tjenesten, hvorefter den normalt startes som en lokal proces eller systemtjeneste.
  2. Kontrollér installationen: Kør ollama –version for at se, om klienten svarer. Kommandoen ollama list viser modeller, der allerede ligger lokalt. En model hentes eksempelvis med ollama pull llama3.2 eller en anden model, som findes i Ollamas modelbibliotek. Llama og Mistral er eksempler på åbne modelserier, men licensvilkår og egenskaber skal undersøges før erhvervsmæssig brug.
  3. Start den første prompt: Kør ollama run llama3.2, og skriv derefter en kort opgave direkte i terminalen. Efter den første download kan genereringen foregå uden eksterne kald, hvis netværksafhængige funktioner ikke er slået til. Prøv eksempelvis at bede modellen om at opsummere en tekst uden at indsætte fortrolige oplysninger i den første test.
  4. Overvåg ressourcerne: Brug htop til CPU og RAM, df -h til lagerplads og relevante GPU-værktøjer, hvis maskinen har NVIDIA-grafik. Langsom generering, swap-brug eller fyldt disk er tegn på, at modellen er for stor, eller at arbejdsbelastningen bør justeres.

Det er vigtigt at skelne mellem lokal modelafvikling og lokale modeldownloads. Selve installationen kræver som regel internet, fordi modelvægte skal hentes. Når filerne ligger på maskinen, kan systemet afkobles fra internettet eller begrænses med firewall-regler. En sådan afkobling bør testes praktisk, især hvis arbejdsflowet senere skal bruge plugins, dokumentindekser eller andre komponenter, der kan forsøge at kontakte eksterne tjenester.

Vidensdeling og arbejdsgange uden at forlade dit lokale netværk

Ollama stiller en lokal API til rådighed, som gør det muligt at forbinde modellen med andre værktøjer. Det kan være en grafisk chatklient, et internt dokumentværktøj, en kodeeditor eller en specialbygget applikation. Ollamas dokumentation beskriver både API-kald og integrationer, mens løsninger som grafiske AI-værktøjer til arbejde og kode viser, hvordan lokale modeller kan indgå i et mere brugervenligt arbejdsflow. En API er dog kun lokal, hvis den er konfigureret sådan. Bind derfor som udgangspunkt tjenesten til localhost, og åbn ikke porten mod hele internettet.

  • Dokumentresuméer: Interne rapporter kan behandles lokalt, så modellen udtrækker hovedpointer, beslutninger og åbne spørgsmål uden cloud-upload.
  • Kodehjælp: Udviklere kan få forklaringer, testforslag og refaktorering af proprietær kode, mens kildekoden bliver i udviklingsmiljøet.
  • Tekstbearbejdning: Lokale modeller kan hjælpe med kladder, klassifikation, sproglig forenkling og søgning i interne procedurer.
  • Intern vidensdeling: Et kontrolleret interface kan samle godkendte modeller, genbrugelige prompts og dokumentkilder på organisationens eget netværk.

Skal flere kolleger bruge løsningen, bør den lokale AI behandles som en rigtig intern tjeneste. Opret separate brugerkonti, anvend single sign-on hvis det er relevant, og adskil arbejdsområder efter afdeling eller projekt. Logning skal være gennemsigtig, begrænset til et legitimt formål og beskyttet mod uautoriseret adgang. Et selvhostet system kan eksempelvis pakkes i Docker, men containeren skal stadig have minimale rettigheder, begrænset filadgang og et klart defineret netværk.

Fortrolige dokumenter bør ikke automatisk monteres ind i modellen eller i containeren. Brug i stedet bestemte mapper med læseadgang, krypterede sikkerhedskopier og en proces for sletning. Hvis der bygges retrieval-augmented generation, hvor modellen søger i et internt dokumentindeks, skal indekset arve de samme adgangsregler som kildedokumenterne. Ellers kan en medarbejder få et svar baseret på materiale, som vedkommende ikke selv måtte åbne. Sikker vidensdeling handler altså både om modelplacering og om klassisk informationssikkerhed.

Byg fremtidens private arbejdsprocesser på dit eget fundament

At køre en sprogmodel lokalt på Ubuntu giver en sjælden kombination af frihed og kontrol. Data kan blive på eget hardware, inference kan foregå offline, og de løbende abonnementsudgifter kan erstattes af en forudsigelig investering i hardware og drift. Samtidig får organisationen mulighed for at vælge model, opdatere i eget tempo og tilpasse brugeroplevelsen til konkrete arbejdsopgaver. Det er ikke en magisk garanti mod datalækager, men det flytter en afgørende del af sikkerhedsansvaret hjem, hvor politikkerne kan håndhæves.

Det konkrete næste skridt er oplagt: vælg en Ubuntu-maskine, opdatér systemet, installér Ollama, hent en mindre model og test et ufarligt arbejdsflow. Mål hastighed, kvalitet og ressourceforbrug, før flere brugere kobles på. Derefter kan åbne modeller, lokal API-adgang, grafiske interfaces og intern vidensdeling bygges på stille og roligt. Med dokumenterede regler, løbende opdateringer og respekt for modellernes licenser kan et åbent AI-fællesskab sætte organisationen i front uden at give afkald på datasuverænitet.