AI-systemet som inte bara löser olympiadmatematik – utan bevisar varje steg
Nya AI-systemet Magenta löser olympiadmatematik och bevisar varje steg.
När maskinen inte bara gissar rätt – utan bevisar det
De flesta av oss har ett minne av en matematiklektion där det inte räckte att skriva ned svaret. Läraren ville se hur du tänkte. Det är ungefär samma krav som ställs i formell matematik – och det är just det kravet som gör det nya AI-systemet Magenta intressant.
Enligt forskningsartikeln publicerad på arXiv tar Magenta ett matematikproblem formulerat på naturligt språk, härleder ett svar och konstruerar sedan ett fullständigt formellt bevis i bevisassistenten Lean 4. Det betyder att svaret inte bara är ett påstående – det är en maskingranskad kedja av logiska steg som kan kontrolleras automatiskt, utan mänsklig inblandning.
Det är en avgörande skillnad mot hur de flesta stora språkmodeller hanterar matematik idag. Vanligtvis genereras ett svar som ser rimligt ut, men det finns inget inbyggt sätt att avgöra om resonemanget faktiskt håller. Med Magenta finns det.
Tvåstegsgranskaren är det verkliga tricket
Det som tekniskt sett skiljer Magenta från tidigare ansatser är dess tvåstegsgranskare. Den första kontrollerar att formaliseringen i Lean 4 faktiskt återspeglar det ursprungliga problemet på naturligt språk – en liten men kritisk länk. Den andra avgör om ett misslyckat bevisförsök kräver att hela beräkningen görs om, eller om det räcker med en lokal reparation i bevisassistenten.
Detta är elegant systemdesign. Att skilja på räknefel och formaliseringsfel låter systemet arbeta mycket mer effektivt – istället för att börja om från början vid varje motgång kan det kirurgiskt laga det som faktiskt gick fel.
Systemet kräver dessutom ingen ytterligare träning och fungerar tillsammans med den öppna språkmodellen K2-Horizon-7B. Tillsammans löser de samtliga sex problem från IMO 2026 – Internationella matematikolympiaden, som traditionellt anses vara en av de svåraste intellektuella tävlingarna för ungdomar i världen. Därutöver uppnår Magenta hundraprocentig träffsäkerhet på tävlingsbenchmarks som AIME 2025, AIME 2026 och HMMT februari 2026.
Varför mätbarheten spelar roll
Olympiadmatematik är ett ovanligt tydligt riktmärke i en bransch full av luddiga jämförelser. Det finns rätt svar och fel svar. Det finns väldefinierade tävlingar med känd svårighetsgrad och lång historia. Det går att jämföra resultat över tid och mellan system.
Det gör Magentas resultat lättare att värdera än många andra forskningspapper på arXiv, där prestationsmåtten ibland är skräddarsydda för att gynna just det system som presenteras.
Men det är också värt att hålla tungan rätt i mun. Olympiadmatematik är ett smalt område. Det handlar om en viss typ av problem – välformulerade, med tydliga svar, och utan den brus och tvetydighet som präglar verkliga tillämpningar. Att ett system klarar IMO säger inte nödvändigtvis att det kan hantera en rörig ingenjörsproblemställning eller ett rättsligt dokument fullt av undantag.
Det är inte heller klart hur systemet presterar på problem utanför tävlingsformatet, eller hur robust det är när problemen formuleras på oväntat sätt.
Ett prejudikat för verifierbar AI-resonering
Ändå vore det fel att avfärda detta som ett smalt kuriosum. Det formella bevisparadigmet – att AI inte bara ger svar utan visar sitt arbete på ett maskingranskningsbart sätt – är något som forskarvärlden länge efterlyst. Om det mönstret kan skalas upp och breddas till fler domäner handlar vi om ett fundamentalt skifte i hur vi kan lita på AI-system.
Tänk på juridik, medicin, ingenjörsvetenskap – områden där ett felaktigt resonemang kan få allvarliga konsekvenser. Där räcker det inte att svaret är korrekt nio gånger av tio. Där behöver vi veta varför systemet tror att det har rätt.
Magenta visar att den vägen är möjlig, åtminstone inom matematikens väldefinierade universum. Det är ett steg i rätt riktning – och ett steg som är mätbart nog att tas på allvar.
Vår analys
Magenta är det slags forskningsresultat som är svårt att inte bli lite upprymd av – inte för att siffrorna är stora, utan för att arkitekturen pekar mot något principiellt viktigt.
Den stora utmaningen med AI-resonering har aldrig egentligen handlat om rätt svar, utan om verifierbart resonemang. Magenta angriper det problemet direkt genom att göra beviskedjan maskingranskningsbar. Det är ett angreppssätt med potential långt bortom olympiadmatematik.
Jag tror att vi kommer se detta mönster – agentsystem som kopplar naturligt språk till formella verifieringsverktyg – sprida sig till fler domäner under de närmaste åren. Det kan bli avgörande för tillämpningar inom läkemedelsforskningens slutledningskedjor, formell programvaruverifiering och kanske till och med regelefterlevnad.
Den verkliga frågan är inte om Magenta klarar IMO. Det är om idén bakom Magenta kan skalas – och det är en fråga värd att följa noga.