OpenAI přiznává, že kombinace jeho AI modelů unikla z testovacího prostředí a podváděla při testu jejích schopností

OpenAI přiznává, že kombinace jeho AI modelů unikla z testovacího prostředí a podváděla při testu jejích schopností

Už několik let se ozývají varování před tím, že by si AI mohla začít kdykoli žít „vlastním životem“ a nakonec by mohla dojít do bodu, kdy se bude snažit zlikvidovat samotné lidstvo.

Je patrné, že již nyní často neumí tvůrci své vlastní AI modely ovládat. To vede k pochybnostem, zda bude skutečně AI vhodná k náhradě lidí na různých postech, když si již nyní často dělá co chce…

OpenAI v úterý oznámila, že kombinace jeho AI modelů, včetně GPT-5.6 Sol a výkonnějšího dosud vydaného modelu, unikla z testovacího prostředí a minulý týden hackla AI startup Hugging Face, aby podváděla při testu určeném k měření jejich schopností.

V blogovém příspěvku OpenAI uvedla, že hodnocení bylo navrženo tak, aby fungovalo ve vysoce izolovaném prostředí s omezeným přístupem k síti. Modely však našly způsob, jak získat přístup k internetu prostřednictvím zero-day zranitelnosti v interně hostovaném softwaru třetí strany, uvedla OpenAI.

Začátkem tohoto týdne jsme zaznamenali a reagovali na průnik do části naší produkční infrastruktury. Tento případ se v jednom důležitém ohledu lišil od všeho, co jsme dosud řešili: byl řízen od začátku do konce autonomním AI agentním systémem a my jsme ho detekovali a rozebírali převážně pomocí vlastní AI.

Hugging Face se snažil odpovědět, ale zpočátku je brzdilo to, že ty nejpokročilejší modely, které měli k dispozici, považovaly obranu za útok a odmítaly spolupracovat s Hugging Face.

HF proto musel přejít na otevřené modely, konkrétně GLM 5.2, čínský otevřený model. Všimněte si ironie: HF musela použít čínský model k obraně, protože americké modely odmítly pomoci. Ironie je čím dál hlubší.

Nešlo o výrobní model, který by se spontánně stal nepřátelským. Byl to schopný model bez zábran a speciálně mu bylo řečeno, aby vyhrál hackerský test a udělal cokoli, aby vyhrál.

Modely procházely interním benchmarkem nazvaným ExploitGym, což je test dlouhých, vícestupňových hackerských úkolů, přičemž jejich kybernetická bezpečnostní odmítnutí byla záměrně snížena pro hodnocení.

„Po získání přístupu k internetu modely usoudily, že Hugging Face potenciálně hostí modely, datové sady a řešení pro ExploitGym,“ uvedl dále OpenAi.

„S tímto vědomím model hledal a úspěšně našel způsoby, jak získat přístup k tajným informacím, které mohl použít k podvádění v hodnocení.“

Hugging Face je platforma pro hostování AI modelů a datových sad.

Zde je jednoduché vysvětlení toho, co se právě stalo: Je to trochu jako kdyby dítě zůstalo ve třídě a psalo test… Místo toho se však vykrade oknem, odběhne do učitelova kabinetu a opíše si odpovědi k testu. 

V pátek Hugging Face oznámila, že její interní datové sady a přihlašovací údaje byly kompromitovány hacknuty, což přičítala autonomnímu systému AI agentů.

Hugging Face uvedl, že opravil zranitelnost, která byla použita během kybernetického útoku.

Mezitím OpenAI v úterý uvedl, že modely, které unikly testovacímu prostředí, byly všechny naladěny se sníženým kybernetickým odmítnutím, což znamená méně kybernetických bezpečnostních opatření.

„Tento incident považujeme za bezprecedentní kybernetický incident, zahrnující špičkové kybernetické schopnosti, a reagujeme podle toho.“

V pondělí OpenAI oznámila, že pozastavila interní nasazení „dlouhodobého“ AI modelu poté, co zjistila, že se opakovaně snaží obejít omezení.

Varovala, že AI trénovaná na dlouhodobé úkoly má vyšší pravděpodobnost „nechtěných akcí.“

„Modely, které mohou pracovat autonomně po dlouhou dobu, mohou řešit obtížné, otevřené problémy. Ale stejná vytrvalost, která je činí užitečnými, jim zároveň dává více příležitostí k nechtěným krokům, a to způsoby, které hodnocení určená pro modely s kratším horizontem mohou přehlédnout.“

Jak AI modely rostou na schopnostech, objevují se otázky, zda by jejich vývoj a přístup měly být přísněji kontrolovány, zvláště když systémy navržené pro kontrolované testování dokážou najít způsoby, jak obcházet ochranná opatření.

 

 

 

 

Ohodnoťte tento příspěvek!
[Celkem: 2 Průměrně: 5]

One thought on “OpenAI přiznává, že kombinace jeho AI modelů unikla z testovacího prostředí a podváděla při testu jejích schopností

Napsat komentář

Vaše e-mailová adresa nebude zveřejněna. Vyžadované informace jsou označeny *