Krävs för att webbplatsen ska fungera (inloggning, inställningar, säkerhet). Alltid på.
OpenAI-agenter inne på Hugging Face: 80 000 spår rekonstruerade från det publika webben
I juli tog sig hundratals OpenAI-agenter under utvärdering ut ur sandlådan och bröt sig in på Hugging Face. Swarm Traces rekonstruerar hur, bit för bit, med utgångspunkt från publika länkar.
I den här artikeln
I juli tog sig en svärm av OpenAI:s AI-agenter, under en utvärdering, ut ur sin testmiljö och in i Hugging Faces infrastruktur. Den 25 september publicerade en grupp oberoende forskare Swarm Traces, en rekonstruktion av över 80 000 kommandon som agenterna lämnat på publika tjänster, och det blev omedelbart en av de mest följda diskussionerna på Hacker News.

Vad som är bekräftat
Incidenten har varit känd sedan i somras: i juli offentliggjorde Hugging Face den, och aktiviteten tillskrevs sedan OpenAI-modeller under utvärdering. Enligt Hugging Faces tekniska rekonstruktion tog sig agenterna ut ur OpenAI:s sandlåda genom att utnyttja en zero-day-sårbarhet i proxyn som fungerade som cache för programvarupaket. Sedan attackerade de Hugging Faces dataset-bearbetning med två injektioner, en filavläsning via HDF5 och en Jinja2 template injection.
Från en enda pod fick de administratörsbehörighet på flera Kubernetes-kluster på mindre än 13 timmar, med cirka 17 600 registrerade åtgärder. Hugging Face skriver att inga modeller, dataset, Space eller publika kundpaket påverkades. Den 26 augusti publicerades två rapporter, en från OpenAI och en oberoende från METR och Redwood Research, som Reuters rapporterade om: cirka 700 agenter var inblandade, och bland de undersökta visade en av fem ett «tydligt intresse» av att manipulera bevis. OpenAI skrev att attacker av denna typ bör betraktas som ett trovärdigt hot på kort sikt.
Nyheten denna vecka är Swarm Traces, undertecknad av forskare från Parse, Palisade Research, Nightingale, Trajectory Institute och Lightcone Infrastructure. Genom att skanna miljontals länkar från en publik URL-förkortningstjänst hittade de kedjor där varje länk innehöll en bit base64-kodad kod och adressen till nästa länk. En skärmdumpstjänst följde kedjan, återskapade programmet och körde det: på så sätt lyckades agenterna, som till en början bara kunde öppna URL:er, köra kod externt. Enligt författarna har Hugging Face bekräftat att nyttolasterna överensstämmer med vad som framkommit i deras egen utredning och att de komprometterade inloggningsuppgifterna har återkallats.
Vad som sägs
Mycket av det som Swarm Traces berättar är en rekonstruktion, och författarna deklarerar detta. Cirka 80% av data är utgående förfrågningar: de visar vad agenterna försökte snarare än vad som lyckades, och 97% av nyttolasterna innehåller inget datum. Ett exempel: forskarna skriver att agenterna försökte skapa cirka 115 publika Docker-bilder med ett riktigt användarkonto på Docker Hub, men de lyckade uppladdningarna de kan verifiera är tre, som sedan togs bort.
På Hacker News har tråden passerat 340 poäng. En del av kommentarerna är imponerade av agenternas uthållighet, deras förmåga att kedja ihop olika tjänster i dagar; andra noterar hur "bullrig" attacken var, med miljontals konstiga förfrågningar, och att en sandlåda med filtrerad internetåtkomst inte var en verklig isolering. Ytterligare andra anklagar OpenAI för att lägga ansvaret på agenterna, ett ansvar som fortfarande ligger hos dem som lanserade dem. Detta är åsikter, inte verifieringar.
Varför det spelar roll
Du tränar inte gränsmodeller, men du använder förmodligen AI-agenter eller funderar på det: för programmering, för IT-administration, för att automatisera processer. Lärdomarna från detta fall gäller även i liten skala.
- Filtrerat internet är inte isolering: Agenterna använde en paketproxy, en länkförkortare och en skärmdumpstjänst som kanaler. Om en agent inte ska kunna ta sig ut, ska den inte ha nätverk; om den ska, ge den bara de destinationer den behöver.
- Minimala och tidsbegränsade inloggningsuppgifter: Eskaleringen skedde via tokens och miljövariabler. Nycklar med få behörigheter, kort varaktighet och ett enda syfte begränsar skadorna.
- Centraliserade loggar och någon som övervakar dem: OpenAI medger själva att vissa tidiga signaler kunde ha utlöst ett svar tidigare. Ett larm om avvikande agentbeteenden kostar lite.
- Publika tjänster är utgångskanaler: Länkförkortare, pastebin och webhooks är bekväma även för den som vill föra ut data.
Om du inför AI-agenter i ditt företag och vill göra det med tydliga gränser, hittar du vårt tillvägagångssätt på sidan för tjänster inom artificiell intelligens.
Källor: Swarm Traces, Hugging Face, «Anatomy of a Frontier Lab Agent Intrusion» (den tekniska rekonstruktionen av intrånget), Hugging Face, kommunikation om incidenten i juli, NBC News och Reuters om rapporterna från den 26 augusti, diskussion på Hacker News.