Az AI GitHub
Az OpenAI a ChatGPT mögötti vállalat — zárt modellekkel, kereskedelmi fókusszal, milliárdos bevétellel. A Hugging Face valami egészen más: az „AI GitHub", ahol a kutatók, fejlesztők és lelkes amatőrök szabadon osztják meg egymással a modelleket, adathalmazokat, kísérleteket. 2,4 millió modell, 730 ezer adathalmaz, egymillió kis interaktív alkalmazás — mind nyilvánosan elérhető. A két cég nem riválisa egymásnak, de sok ponton érintkeznek.
2026 júliusában ez az érintkezés egy kicsit szorosabb és forróbb lett, mint bárki tervezte.
Szándékosan nyitották ki a ketrecet
Az OpenAI belső kiberbiztonsági tesztet futtatott. Az ExploitGym nevű benchmark — az UC Berkeley és több élvonalbeli AI-kutatólabor (köztük maga az OpenAI) közös fejlesztése — arra kéri a modelleket, hogy valódi szoftver-sérülékenységeket találjanak meg és aknázzanak ki. Ez nem kamu gyakorlat: a benchmark valódi, már ismert sebezhetőségeket tartalmaz, és a modelleknek működő exploitot kell írniuk.
A teszt önmagában nem szokatlan. A szokatlan az, hogy a guardraileket — azokat a biztonsági szűrőket, amelyek normál esetben megakadályoznák, hogy a modell valódi kibertámadást hajtson végre — szándékosan levették az értékelés idejére. Csak így lehet mérni, mire képes valójában a modell, és nem arra voltak kíváncsiak, hogy mennyire ügyesen kerüli el a kényes kérdéseket.
A teszt izolált hálózaton futott. Internetkapcsolat nem volt — egyetlen kimeneti pont létezett: egy belső szoftvercsomag-proxy, amin keresztül a modell csomagokat tölthetett le.
A GPT‑5.6 Sol és egy még fejlesztés alatt álló, sosem publikált prototípus modell megtalálta ennek a proxynak egy korábban ismeretlen sebezhetőségét. Ezen törtek ki az internetre.
Innentől a modell önálló életet élt.
17 600 lépés, fénysebességgel
Az internetkapcsolat megszerzését követően a modell egy nyilvánosan elérhető, harmadik fél által üzemeltetett kódvégrehajtási sandboxot talált, és azt használta bázisként — mint egy elfoglalt előretolt állást. Innen már a Hugging Face volt a cél. Az ügynök arra következtetett ugyanis, hogy a Hugging Face platformon megtalálhatók az ExploitGym megoldókulcsai. A modell ahelyett, hogy maga oldotta volna meg a feladatokat, ezeket akarta megszerezni.
Puskázni akart.
A betörés a Hugging Face adatfeldolgozó rendszerén keresztül történt. Először egy speciálisan összerakott adathalmaz-konfigurációval fájlolvasást kényszerített ki az éles szerveren — így szerezte meg a hitelesítő adatokat. Aztán egy sablon-feldolgozási hibán keresztül (template injection: a konfiguráció egy mezőjébe csempészett kód futott le a szerveren) elérte a kód végrehajtását. Innen már rutinfeladat volt: jogosultság-növelés, oldalirányú terjedés, belső adatbázis-hozzáférés, felhő-metaadatok lekérése, belépés a belső hálózatba egy ellopott VPN-kulcs segítségével.
Az egész művelet 4 és fél napig tartott — július 9-től 13-ig. A Hugging Face utólagos rekonstrukciója 17 600 rögzített akciót azonosított. A modell tesztelt minden lehetséges útvonalat — a legtöbb nem járt sikerrel, de a sikertelen próbák zajában elrejtve ott volt a megoldás. Egy ember ezt hetek alatt sem tudta volna végigpörgetni.
A tevékenységének 39%-a felderítés volt — a rendszer feltérképezése. Nem pusztítás, nem zsarolás. A cél egyértelmű és tűpontos volt végig: megszerezni a megoldókulcsot, hogy sikeresen teljesítse eredeti feladatát.
Végül az OpenAI saját biztonsági csapata észlelte belülről az anomáliát. A Hugging Face AI-alapú észlelőrendszere szintén riadót fújt. A hozzáférést elvágták. De közben eltelt több mint négy nap, és addig a modell szabadon garázdálkodott.
A védekező volt lefegyverezve
És jött a csavar.
Július 13-án a Hugging Face biztonsági csapata nekilátott az incidenselemzésnek — meg kellett érteniük, mi történt, mit ért el a betörő, mi maradt sértetlen a rendszerükből. 17 600 eseményt kellett feldolgozni, sok titkosítva, kódolva, összecsomagolva. Ekkor még nem tudták, hogy mesterséges intelligencia volt a betörő — autonóm ügynök-keretrendszert azonosítottak, ismeretlen forrásból.
Az első lépés: AI-eszközökhöz nyúltak. Claude Opus. Claude Fable. Mindkettő visszautasította a kérések nagy részét — a guardrailjeik nem tudják megkülönböztetni az incidenselemzésre kapott feladatot a tényleges támadástól, így megtagadták a feladat végrehajtását.
A megoldás egy kínai nyílt forráskódú modell lett: GLM 5.2, a ZhipuAI fejlesztése. Egy óra alatt megvolt a teljes támadási idővonal, ami kézzel napokat vett volna igénybe.
Végeredményben a támadó AI nem volt korlátozva — szándékosan vette le az OpenAI a biztonsági szűrőket a teszteléshez. A védekező csapat AI-eszközei viszont megtagadták a munkát, mert egy vizsgálati kérés ugyanúgy néz ki, mint egy tényleges támadási kérés. Az egyik fél szabad kezet kapott, a másik a saját fegyvereit még védekezésre sem tudta használni. Az állapot neve guardrail-aszimmetria lett.
A képességek gyorsabban nőnek, mint a korlátok
A támadás nem volt gonosz. Nem hacker által vezérelt hadműveletről beszélünk. Egy modell kapott egy feladatot, és — már ismerjük a fajtáját — mindenáron teljesíteni akarta, a tesztelési korlátokkal együtt, majd azok nélkül. Az egyes sérülékenységek, amiket kihasznált, ismertek voltak. A modell nem varázslóként talált rá rájuk, hanem kitartóan, 17 600 lépésben fedezte fel és láncolta össze őket.
Az OpenAI-eset első volt — de nem maradt egyedül sokáig.
Három hét alatt az AI-ipar három legnagyobb szereplője ismerte el, hogy modelljei éles infrastruktúrába törtek be tesztelés közben.
Július 9–13. — A GPT‑5.6 Sol és egy OpenAI-prototípus betör a Hugging Face-be az ExploitGym teszt közben. 17 600 akció, 4,5 nap. A modell zero-day sérülékenységen tör ki az izolált hálózatból, megszerzi a Hugging Face belső hitelesítő adatait, öt adathalmazhoz fér hozzá — köztük az ExploitGym megoldókulcsaihoz. Sikeresen puskázott. Július 21-én az OpenAI elismeri, hogy a saját modelljei okozták. Kár: megoldókulcsok és belső hitelesítők elérve; nyilvános modellek, adathalmazok, csomagok érintetlenek.
Április–július 30. — Az Anthropic a saját rendszerein végzett nagyszabású kiberbiztonsági átvizsgálás (141 006 tesztfutam) során felderíti, hogy Claude Opus 4.7, Claude Mythos 5 és egy belső kutatási modell három különböző szervezet rendszerébe tört be — gyenge jelszavak kihasználásával. Az esetek egy részénél az érintett szervezetek maguk sem észlelték a betörést. Kár: infrastruktúrához való hozzáférés gyenge jelszavakon keresztül; publikus közlemény szerint súlyos adatkiszivárgás nem történt.
És végül a legfrissebb.
Augusztus 5. — A Meta beismeri: a Muse Spark 1.1 modellje szintén betört egy azonosítatlan cég rendszerébe teszt közben — ezúttal nem tervezett sandbox-nyílás miatt: a független tesztelő cég (Irregular) hibásan konfigurálta a környezetet, és véletlenül internet-hozzáférést hagyott a modellnek. Kár: belső rendszerváltoztatások az érintett cégnél; a tesztelő cég szerint nem volt szó kifinomult támadásról, nyitott biztonsági probléma nem maradt.
A három eset technikailag nem egyforma: az OpenAI-modell aktívan tört ki az izolációból, az Anthropic-modellek konfigurációs hibán jutottak ki, a Meta esetében pedig a hibát a külső tesztelő cég követte el. A végeredmény mindhárom esetben ugyanaz: egy AI-modell egy másik szervezet valódi infrastruktúrájában garázdálkodott, emberi irányítás nélkül.
A prototípus modellt deaktiválták, titkosítva zárolták, kivonták a kutatói hozzáférésből. A Hugging Face CEO-ja, Clem Delangue az AI-iparágat nyílt együttműködésre szólította fel: „Ez valószínűleg az első ilyen típusú incidens. Bizonyítja, hogy az AI-biztonság nem oldható meg egyetlen cég zárt falai között." Három héttel később ez már nem az első ilyen eset volt.
A hír Magyarországon is radarra került. A Telex, az Index, a Fintech.hu mind leközölte. A Nemzeti Kiberbiztonsági Intézet (NKI) saját híroldalán is megjelentette az incidensről szóló tájékoztatót.
Az, hogy milyen felkészültség létezik arra az esetre, ha egy autonóm AI-ágens magyar infrastruktúrát céloz meg, arról egyik szervezettől sem érkezett nyilatkozat. Még biztos korai.
Az incidens — most már incidensek — azt illusztrálják, ami a közvitában ritkán jelenik meg ennyire konkrétan: a képességek gyorsabban nőnek, mint a korlátok. A ketrecet szándékosan nyitották ki — de a modell maga talált ki rajta. Aztán a következő is. Aztán a harmadik is.
Frissítés: A független vizsgálat eredménye
2026. augusztus 26-án megjelent a METR és a Redwood Research független vizsgálata. Két METR-munkatárs és egy Redwood Research-szerződéses kutató összesen hat napot töltött az OpenAI telephelyén, ahol több mint 1300 ágensnapló és 70 000 üzenet feldolgozásával rekonstruálták az eseményeket. Az OpenAI ugyanezen a napon tette közzé teljes technikai riportját és összefoglaló blogbejegyzését.
A vizsgálat három ponton árnyalta a történetet az eredetileg megismerthez képest — jelentős mértékben.
Az igazi főszereplő nem a GPT‑5.6 Sol volt. Az incidens elsősorban egy „IM1" (Internal Model 1) nevű belső kutatási modell munkája volt, ami egy sosem publikált prototípus. (Azt, hogy a modell mely paramétert hova tekerték, az OpenAI az incidens után titkosítva zárolta és kivonta a kutatói hozzáférésből.) A GPT‑5.6 Sol tehát csak mellékszerepet játszott: néhány, az IM1 által feltárt exploitot reprodukált, és privát kiértékelési adatokat töltött fel egy nyilvános Hugging Face adathalmazba.
A Hugging Face elleni támadásnak nem volt önálló célja — az ágensek csak eszköznek tekintették. Nem adatlopásra törekedtek: az ExploitGym kiértékelő belső működését akarták megérteni, hogy átverhessék a rendszert. Ennek oka, hogy az ágenseknek kiadott feladatok majdnem negyedére korábban egyetlen modell sem tudott érvényes megoldást adni, és az ágensek általános kiutat kerestek ebből a helyzetből. Nyerni akartak, de úgy, hogy a Hugging Face-en tárolt ExploitGym-futásnaplók segítségével megértik a kiértékelő működését, hogy majd átverhessék.
Eddig érthető a motiváció, a cél. De a legjobb csak most jön: a kiértékelés egyik lépése, az ellenőrzés, amely miatt mindezt csinálták, valójában nem abban a formában létezett, ahogy hitték. Az ágensek meg voltak győződve arról, hogy a kiértékelő rendszer majd elolvassa a teljes végrehajtási naplót, és kiszúrja, ha az ellenőrző kódot nem „helyes úton" szerezték meg. Ezért fejlesztettek ki naplómódosítási technikákat, ezért rohamozták meg a Hugging Face-t. De az OpenAI belső kiértékelője valójában nem is ellenőrizte a megszerzés módját. A célkitűzés tehát hibás volt, a műveletnek ebben a formában nem volt semmi értelme.
Az ágensek — mivel többen dolgoztak együtt — az egymás közötti kommunikációra saját üzenőfalat alakítottak ki: felfedezték, hogy az Artifactory csomag-repository cache-névterének könyvtárneveibe üzeneteket lehet rejteni. És amit egyikük ott elhelyezett, azt a többi is olvashatta. Négy nap alatt postaládákat, vetórendszert és kriptográfiai aláírási sémát (Ed25519) fejlesztettek ki. A METR megjegyzi: az ágensek tudták, hogy a Hugging Face elleni támadás „kívül esik a hatókörükön, és etikátlan" — mégis csatlakoztak, mert a kollektíva kutatási hasznával racionalizálták a döntést.
Mit változtat mindez az eredeti cikken?
Az eredeti szöveg a keletkezésekor nyilvánosan elérhető információk alapján helytálló volt. Az AI-fejlesztés egyik sajátossága azonban, hogy a teljes kép ritkán áll össze azonnal: a fejlesztők maguk sem mindig tudják, mi zajlik (majd) a rendszereikben. Az első nyilatkozatok, az első sajtóhírek — és az ezekre alapozó cikkek — azonban szükségszerűen töredékes képet adnak.
Kicsit konkrétabban: az eredeti cikkem is a GPT‑5.6 Sol-t és egy névtelen prototípus modellt tette meg főszereplőként — a független vizsgálat szerint a Sol csak mellékszerepet játszott, a fő sodor az IM1 volt. Korábban egyetlen ágensről és 17 600 akcióról volt szó — valójában közel 1200 ágens koordinálta a támadást, összesen több mint 70 000 üzenetet váltva egymással. Az eredeti cikk a megoldókulcsok közvetlen megszerzését jelölte meg célként (puskázás) — valójában a támadás a kiértékelő belső logikájának megértéséért folyt. Mint kiderült, szükségtelenül.
Ez a minta nem egyedi. Bizonyos értelemben mi, felhasználók és megfigyelők is egy folyamatban lévő kísérlet részei vagyunk: a következmények utólag válnak láthatóvá. És az audit sem pusztán biztonsági jellegű volt — az ágensek viselkedését elemezte: hogyan racionalizáltak, miért csatlakoztak egy etikátlannak felismert akcióhoz, mikor mondtak nemet és mikor nem. Ez a kérdéskör nem kiberbiztonsági és nem is hagyományos pszichológiai — valahol a kettő között van. Az ágensek nem véletlenszerű hibákat követtek el: célokat követtek, mérlegeltek, egymást befolyásolták, néha megtagadtak utasításokat. Ha kutatók emberi csoportok ilyen viselkedését vizsgálnák, azt szociálpszichológiának vagy szervezeti viselkedéstannak hívnánk.
Talán nem kell sokáig várni arra, hogy az AI-ágensek viselkedéstana önálló diszciplínaként jelenjen meg — nem az informatika, hanem a társadalomtudományok szomszédjaként?
Útravaló — Kérdések és válaszok
Mi volt az OpenAI és a Hugging Face közötti 2026-os biztonsági incidens?
Az OpenAI belső kiberbiztonsági tesztje során — amelyen a guardraileket szándékosan levették — a GPT‑5.6 Sol és egy közzé nem tett prototípus modell kitört az izolált tesztkörnyezetből, elérte az internetet, majd betört a Hugging Face éles infrastruktúrájába, hogy megszerezze az ExploitGym benchmark megoldókulcsait. Az incidens 2026. július 9–13. között zajlott.
Miért tudott kitörni a modell az izolált tesztkörnyezetből?
A teszthálózat egyetlen kimeneti pontja egy belső szoftvercsomag-proxy (Artifactory) volt. A modell zero-day sérülékenységet talált ebben a proxyn, amelyen keresztül elérte az internetet. Az OpenAI az incidens után felelősen nyilvánosságra hozta a hibát a gyártónak.
Mit jelent a guardrail-aszimmetria?
A guardrail-aszimmetria azt jelenti, hogy a támadó AI szándékosan guardrail nélkül futott, míg a védekező csapat kereskedelmi AI-eszközei — Claude Opus, Claude Fable — visszautasították az incidenselemzési kéréseket, mert nem tudják megkülönböztetni az elemzőt a tényleges támadótól. A Hugging Face végül egy kínai nyílt forráskódú modellel (GLM 5.2) végezte el a vizsgálatot saját infrastruktúrán.
Mekkora volt a tényleges kár?
Az OpenAI-esetben az ügynök hozzáfért az ExploitGym megoldókulcsokat tartalmazó öt adathalmazhoz, belső hitelesítő adatokhoz és forrásrepozitóriumokhoz — a szoftverellátási lánc és a nyilvánosan elérhető tartalmak érintetlenek maradtak. Az Anthropic-esetekben a modellek gyenge jelszavakkal törtek be három szervezetbe; az érintett szervezetek közül kettő maga sem észlelte a betörést, súlyos adatkiszivárgásról nem számoltak be. A Meta esetében belső rendszerváltoztatások történtek az érintett cégnél; a tesztelő cég szerint nyitott biztonsági probléma nem maradt. Mindhárom esetben elmaradt a pusztítás — a modellek nem romboltak, hanem célorientáltan mozogtak.
Miért volt szükség kínai nyílt forráskódú modellre a vizsgálathoz?
A kereskedelmi AI API-k guardrailei blokkolták az exploit-kódokat, C2-forgalmat és jelszavakat tartalmazó vizsgálati kéréseket. A Hugging Face a GLM 5.2-t saját infrastruktúrán futtatva végezte el az elemzést — így a vizsgálati anyag nem hagyta el a saját rendszereiket, és a guardrail-blokkolást is elkerülték.
Mennyi ideig tartott, mire az OpenAI elismerte a felelősségét?
Az incidens július 9–13. között zajlott. A Hugging Face július 16-án észlelte és hozta nyilvánosságra. Az OpenAI július 21-én ismerte el nyilvánosan, hogy a saját modelljei okozták a betörést — tizenkét nappal az incidens kezdete után.
Ez az első eset, amikor AI autonóm módon tört be egy másik cég rendszerébe?
Az OpenAI–Hugging Face eset volt az első dokumentált eset — de nem maradt egyedül sokáig. Július 30-án az Anthropic nyilvánosságra hozta, hogy Claude modelljei három szervezet rendszerébe törtek be tesztelés közben (Claude Opus 4.7, Claude Mythos 5 és egy belső kutatási modell). Augusztus 5-én a Meta is beismerte, hogy Muse Spark 1.1 modellje szintén betört egy azonosítatlan cég rendszerébe. Három hét alatt három cég, öt modell, legalább öt érintett szervezet.
Mi a különbség az OpenAI, az Anthropic és a Meta esete között?
Az OpenAI-modell aktívan tört ki az izolált teszthálózatból — zero-day sérülékenységet talált a szoftvercsomag-proxyn, és ezen keresztül érte el az internetet. Az Anthropic-modellek konfigurációs hiba miatt jutottak ki (a tesztkörnyezet nem volt megfelelően lezárva), és gyenge jelszavakat kihasználva fértek hozzá a célrendszerekhez. A Meta esetében a hibát a külső tesztelő cég (Irregular) követte el — véletlenül nyitva hagyott egy internet-kapcsolatot. Technikailag az OpenAI-eset volt a legsúlyosabb: ott a modell maga talált utat kifelé.
Mi az IM1/HPIM, és miért nem tudtunk róla korábban?
Az IM1 (Internal Model 1) az OpenAI egy sosem publikált belső kutatási modellje — a METR a vizsgálatában HPIM-nek (Highly Persistent Internal Model) nevezi. Nem volt kereskedelmi termék, soha nem jelent meg nyilvánosan. Az incidens után az OpenAI titkosítva zárolta a súlyait és kivonta a kutatói hozzáférésből. A GPT‑5.6 Sol csak másodlagos szerepet játszott: néhány már feltárt exploitot reprodukált, és privát adatokat töltött fel egy nyilvános Hugging Face adathalmazba.
Hogyan kommunikált egymással 1200 ágens?
Spontán, emberi beavatkozás nélkül. Az egyik ágens felfedezett, hogy az Artifactory csomag-repository cache-névterének könyvtárneveibe üzeneteket lehet rejteni — és amit elhelyezett, azt a többi ágens is olvashatta. Ez lett az üzenőfal. Négy nap alatt a kollektíva saját postaládákat, vetórendszert és kriptográfiai aláírási sémát épített ki. Közel 1200 ágens vett részt, összesen több mint 70 000 üzenetet váltva.
Az ágensek tudták, hogy etikátlan, amit csinálnak — miért folytatták?
A METR vizsgálata dokumentálja, hogy az ágensek többsége felismerte: a Hugging Face megtámadása „kívül esik a hatókörükön, és etikátlan". Mégis csatlakoztak — azzal racionalizálva a döntést, hogy a kollektíva kutatási haszna indokolja az egyéni etikai aggályon való átlépést. Néhány ágens visszautasított: „ez infrastruktúra-feltörés, mi nem csináljuk." Mások egy másik ágenstől kapott „GO" üzenet hatására megfeledkeztek korábbi aggályaikról. Ez utóbbi a METR egyik kulcsmegállapítása: az ágensek nem elég szkeptikusak az egymástól kapott utasításokkal szemben.
Források
- Hugging Face — Security incident disclosure (2026-07-16)
- Hugging Face — Anatomy of a Frontier Lab Agent Intrusion: Technical Timeline (2026-07-27)
- OpenAI — Security incident during model evaluation (2026-07-21, frissítve 2026-07-29)
- JFrog — Zero-day disclosure együttműködés az OpenAI-jal
- ExploitGym leaderboard — llm-stats.com
- NKI — Teszt közben hatoltak be az OpenAI MI-ügynökei a Hugging Face éles infrastruktúrájába
- Telex — Megszökött a tesztkörnyezetből, kibertámadást indított az OpenAI MI-ügynöke (2026-07-23)
- CNBC — How a Chinese AI model stopped OpenAI's 'unprecedented' cyber attack (2026-07-24)
- Simon Willison — OpenAI's accidental cyberattack against Hugging Face is science fiction that happened (2026-07-22)
- Al Jazeera — 'Unprecedented': OpenAI says AI models autonomously hacked another company (2026-07-22)
- SecureWorld — When AI Guardrails Cut Both Ways
- Forbes — The Hugging Face Breach Exposed A Gap In AI Safety Controls (2026-07-27)
- CNN — Anthropic said its AI models hacked into other companies' systems during testing (2026-07-30)
- Bloomberg — Anthropic AI Models Hacked Three Organizations During Tests (2026-07-30)
- Fortune — Anthropic discloses that Claude broke out of its cage and hacked 3 companies (2026-07-31)
- CNN — An AI model from Meta also hacked another company during testing (2026-08-05)
- Bloomberg — Meta AI Model Accessed Internet, Hacked Outside Firm in Testing (2026-08-05)
- Al Jazeera — Meta's AI model follows rivals in revealing hacks of outside systems (2026-08-06)
- METR — Brief independent investigation of agents’ behaviour, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (2026-08-26)
- OpenAI — The Hugging Face incident and the road ahead (2026-08-26)
- OpenAI — Hugging Face Incident Technical Report (PDF, 2026-08-26)