Ny AI-metod förbättrar agentprestanda med upp till 65 procent – och avlastar cancerregistratorer
AI-agenter lär sig av sina misstag – och presterar 65 procent bättre.
När AI slutar låtsas och börjar leverera
Det är lätt att bli avtrubbad av AI-nyheter. Varje vecka presenteras nya modeller, nya riktmärken, nya rekord. Men ibland landar det forskning som faktiskt förändrar något i grunden – inte bara siffrorna, utan logiken bakom hur AI-system lär sig att fungera i den röriga verkligheten.
Detta är en sådan vecka.
Forskare vid arXiv publicerade nyligen resultat kring en ny träningsmetod för AI-agenter kallad Privilegierad självträning (på engelska Privileged Self-Practice, PSP). Bakgrunden är ett elegant identifierat problem: den populära metoden självdestillation – där en agent lär sig av sina egna handlingar – har en allvarlig brist. Den tränar agenten att agera med självförtroende baserat på information den aldrig faktiskt har tillgång till i skarpt läge. Resultatet? I värsta fall presterar den tränade agenten sämre än en helt otränad modell. Det är som att träna en kirurg på operationer som aldrig äger rum i verkligheten.
PSP löser detta på ett elegant sätt: den privilegierade informationen används inte för att påverka träningsförlusterna direkt, utan enbart för att välja ut vilka träningsexempel agenten ska lära sig av. När agenten misslyckas injiceras en kort analys från en extern modell, och agenten tränas sedan på det förbättrade resultatet. Enkelt i teorin – kraftfullt i praktiken.
Resultaten på riktmärkena AppWorld och SWE-bench Verified talar för sig själva: upp till 65 respektive 61 procents förbättring jämfört med tidigare metoder. PSP var dessutom den enda metod som konsekvent slog grundläggande förstärkningsinlärning – ett resultat som är svårt att avfärda.
Cancerregistratorn får en intelligent kollega
Samtidigt, i ett helt annat forskningshörn, pågår en tystare men minst lika viktig omvandling. Amerikanska forskare har utvecklat CRISS – Cancer Registry Intelligent Support System – en AI-driven chattassistent skapad för att stödja de specialister som ansvarar för cancerregistrering.
Detta är ett yrke de flesta aldrig hört talas om, men som är avgörande för hur vi förstår och bekämpar cancer som samhälle. Cancerregistratorer tolkar och tillämpar enormt komplexa kodnings- och klassificeringsstandarder – ett arbete som kräver djup domänkunskap och där ett felsteg kan påverka statistik, forskning och i förlängningen behandlingsbeslut.
CRISS bygger på så kallad RAG-teknik – hämtningsförstärkt generering – där en specialiserad kunskapsbas indexeras och ger svar med tydliga källhänvisningar. Systemet presterade genomgående bättre än varianter utan denna teknik, särskilt vid komplexa frågor. Och här är det viktiga: CRISS är inte byggt för att ersätta experten. Den slutliga bedömningen fattas alltid av en kvalificerad registrator. AI:n är en kunnig kollega som snabbt hittar rätt vägledning – inte en automat som tar över.
Samma berättelse, olika scener
Vad har dessa två forskningsresultat gemensamt? Mer än det kan verka vid första anblick.
Båda handlar om AI som lär sig att hantera verklig komplexitet – inte laboratoriemiljöer med perfekt information, utan röriga, domänspecifika situationer där fel får konsekvenser. Båda visar att framstegen inte alltid kommer från större modeller, utan från smartare träningsmetoder och bättre systemdesign.
För svenska användare och patienter är detta högst relevant. Inom svensk sjukvård finns redan intresse för att använda AI som beslutsstöd, men tillit och säkerhet är rättmätiga krav. Det som gör CRISS intressant är just dess transparens – källhänvisningarna gör det möjligt för experten att granska och ifrågasätta. Det är inte blind automatisering; det är förstärkt mänsklig expertis.
Och när AI-agenter generellt blir 65 procent bättre på att slutföra komplexa uppgifter börjar vi röra oss in i ett territorium där automation av kvalificerade arbetsflöden inte längre är en framtidsfantasi. Det händer nu, i forskning som snabbt omvandlas till produkter.
Vår analys
De här två resultaten representerar olika lager av samma tektoniska rörelse: AI går från imponerande demo till tillförlitligt arbetsredskap. PSP-metoden är intressant inte för att den slår ett riktmärke, utan för att den identifierar och åtgärdar ett principiellt fel i hur agenter tränas – det är mognadsprocessen i action. CRISS är å sin sida ett utmärkt exempel på hur man bygger AI-stöd rätt: med transparens, källhänvisningar och mänsklig kontroll i centrum.
För svenska organisationer – vare sig det gäller sjukvård, myndigheter eller privat sektor – är lärdomen tydlig: det lönar sig att investera i domänspecifika lösningar med inbyggd tillförlitlighet, snarare än att vänta på en universallösning. Kombinationen av bättre agentförmåga och domänförankrad RAG-teknik kommer att skapa en ny generation verktyg under de närmaste åren. De som förstår det nu bygger försprång som blir svåra att hämta in.