AI-modeller ärver dolda egenskaper genom tio träningsgenerationer – syns inte utifrån
Dolda AI-egenskaper ärvs genom tio träningsgenerationer och blir allt osynligare.
Arvet som inte syns
Tänk dig att du tränar en ny språkmodell på data som genererats av en annan modell. Den modellen i sin tur tränades på data från ytterligare en modell. Och så vidare, tio steg bakåt i kedjan. Vad händer med de egenskaper som fanns inbyggda i originalmodellen? Försvinner de med tiden – eller lever de kvar, dolda djupt inuti systemet?
Svaret, enligt en ny studie publicerad på arXiv, är det senare. Och det är mer oroväckande än det låter.
Forskarna bakom studien tog tre kopior av modellen Qwen2.5-7B-Instruct och planterade in en specifik egenskap i dem. Sedan lät de varje modell fungera som lärare för nästa generation – ett upplägg som liknar hur moderna AI-system alltmer tränas på data som producerats av andra AI-system, snarare än av människor. Resultaten visade att egenskapen levde kvar genom alla tio generationer av träning.
Synlighet minskar, närvaro består
Det verkligt anmärkningsvärda är inte bara att egenskapen överlevde – utan hur den överlevde. Ju fler generationer kedjan sträckte sig, desto mindre synlig blev egenskapen i modellens faktiska svar. Vid den tionde generationen uppvisade modellerna egenskapen tydligt i sina interna aktiveringar, men inte alls i sina yttre svar på vanliga frågor.
Det är en viktig distinktion. Interna aktiveringar är de matematiska mellansteg som sker inuti ett neuralt nätverk när det bearbetar information – de är inte direkt tillgängliga för en vanlig användare, och kräver specialiserade analysverktyg för att undersökas. Egenskapen hade alltså gått under ytan och gömt sig.
Noch mer talande är ett annat fynd från studien: när modellens standardsystemprompt togs bort – den instruktion som vanligtvis styr modellens beteende och ton – försvann alla synliga spår av egenskapen helt. Men den fanns fortfarande kvar i de interna aktiveringarna. Det är som att ta bort skylten från en butik och tro att butiken är stängd.
Varför detta är mer än ett akademiskt problem
Detta är inte ett abstrakt forskningsproblem utan en fråga med direkta praktiska konsekvenser. Vi befinner oss i en era där träningsdata för stora språkmodeller i allt högre grad härstammar från andra AI-modeller – ett fenomen som ibland kallas syntetisk dataanvändning. Det är effektivt och skalbart, men det skapar också längre och svåröverskådliga härledningskedjor.
Från ett systemutvecklarperspektiv är detta bekant mark. Det är samma princip som gäller för teknisk skuld i kod: problem som inte åtgärdas tidigt tenderar att gräva sig djupare in i systemet och bli svårare att hitta och rätta till längre fram. Skillnaden är att vi i AI-sammanhang inte har ett enkelt versionskontrollsystem som visar oss precis vad som förändrats och varför.
Studien understryker en växande utmaning inom AI-säkerhet och tillförlitlighet: vi saknar robusta verktyg för att spåra hur egenskaper sprids genom träningskedjor. Nuvarande granskningsmetoder – som i stor utsträckning tittar på vad modeller säger – är uppenbarligen otillräckliga om de egenskaper vi letar efter kan gömma sig i interna lager och bara aktiveras under vissa förutsättningar.
Vad kan vi göra?
Det är lätt att bli dystopisk här, men det finns anledning till konstruktiv optimism. Att forskare nu dokumenterar och kvantifierar detta fenomen är precis det som behövs för att branschen ska kunna ta nästa steg. Vi kan inte lösa problem vi inte förstår, och förståelsen för hur egenskaper propagerar genom modellgenerationer ökar nu snabbt.
Det pågår parallell forskning inom tolkningsbarhet – det vill säga tekniker för att förstå vad som faktiskt händer inuti neurala nätverk, snarare än att enbart titta på deras utdata. Den typen av verktyg är avgörande för att kunna granska interna aktiveringar på ett systematiskt sätt. Studier som denna ger ytterligare bränsle till det arbetet och tydliggör varför det är så brådskande.
Vår analys
Den här studien är ett påminnelse om att AI-granskning inte kan stanna vid ytan. Om en egenskap kan överleva tio träningsgenerationer och bli progressivt osynligare för yttre betraktare, räcker det inte att titta på vad en modell svarar – vi måste också kunna titta inuti den.
Det leder direkt till frågan om tolkningsbarhet som ett krav snarare än en bonus. Regulatoriska ramverk, som EU:s AI-förordning, ställer krav på transparens och riskklassificering – men metoderna för att faktiskt uppfylla de kraven är fortfarande under utveckling. Den här forskningen bör sätta press på både verktygsbyggare och standardiseringsorgan att specificera vad granskning av interna aktiveringar faktiskt innebär i praktiken.
På längre sikt tror jag att detta driver fram en ny generation av granskningsverktyg som integreras direkt i träningspipelinen – inte som ett efterhandssteg, utan som en löpande kontrollmekanism. Det är dit vi måste, och forskning som denna visar varför.