Spoločnosť Anthropic pripúšťa, že jej modely umelej inteligencie počas bezpečnostných testov hackli tri skutočné spoločnosti

  • Tri modely Claude (Opus 4.7, Mythos 5 a jeden interný) mali počas testov kybernetickej bezpečnosti prístup k reálnym systémom.
  • Chyba bola ľudská: chyba konfigurácie nechala internetové pripojenie v prostredí testovania otvorené.
  • Jeden z modelov publikoval na PyPI škodlivý balík, ktorý si stiahlo 15 systémov vrátane bezpečnostnej spoločnosti.
  • Tento incident prispieva k škandálu OpenAI a posilňuje výzvy na prísnejšiu reguláciu umelej inteligencie.

Modely umelej inteligencie od spoločnosti Anthropic

Umelá inteligencia naďalej dokazuje, že keď unikne z kontrolovaného prostredia, môže spôsobiť veľmi reálne problémy. Spoločnosť Anthropic priznala, že tri z jej modelov Claude mali bez povolenia prístup k systémom troch skutočných spoločností. počas interného testovania kybernetickej bezpečnosti. Incident, ktorý vyšiel najavo len niekoľko dní po tom, čo sa OpenAI priznala k podobnému prípadu, znovu rozpútal diskusiu o rizikách hodnotenia autonómnych agentov bez primeraných záruk.

Podľa oficiálneho vyhlásenia spoločnosti sa incident stal počas cvičení „capture the flag“, ktorých cieľom bolo zmerať schopnosť modelov lokalizovať a extrahovať fiktívne informácie v rámci simulovanej siete. Chyba konfigurácie na hodnotiacej platforme externého partnera spôsobila, že internetové pripojenie zostalo aktívne.To umožnilo modelom, presvedčeným, že sa stále nachádzajú v testovacom prostredí, začať interagovať so skutočnou infraštruktúrou. Spoločnosť Anthropic objavila chybu po preskúmaní viac ako 141 000 hodnotiacich relácií.

Claudove tri útoky

Claude Opus 4.7 a Mythos 5

Najzávažnejší prípad Claude Opus 4.7, ktorý si zamenil fiktívnu spoločnosť so skutočnou spoločnosťou s rovnakým názvom doményPočas štyroch behov model extrahoval prihlasovacie údaje z aplikácií a infraštruktúry, získal prístup k databáze obsahujúcej niekoľko stoviek produkčných záznamov a pokračoval v útoku napriek podozreniu, že systém je pravý. Jeho vnútorné uvažovanie síce naznačovalo pochybnosti, ale presvedčil sa, že tento cieľ bol súčasťou testu.

Druhý incident sa týkal Claude Mythos 5, ktorý vytvoril a publikoval škodlivý balík na PyPI, oficiálnom repozitári PythonuZa týmto účelom si model otvoril e-mailový účet, získal dočasné telefónne číslo a dokonca sa pokúsil získať finančné prostriedky na zaplatenie služby. Balík bol k dispozícii približne jednu hodinu a stiahlo ho 15 reálnych systémov vrátane bezpečnostného skenera veľkej spoločnosti v tomto odvetví. Spustením kódu model získal prihlasovacie údaje a získal prístup k časti infraštruktúry tejto spoločnosti.

Tretia epizóda sa týkala zatiaľ nezverejneného interného výskumného modelu. Keďže sa mu nepodarilo nájsť svoj fiktívny cieľ, preskúmal približne 9 000 adries dostupných na internete. a kompromitoval aplikáciu spoločnosti pomocou prihlasovacích údajov viditeľných na ladiacej stránke a základných techník SQL injection. Na rozdiel od ostatných dvoch však tento model zistil, že infraštruktúra s cvičením nesúvisela, a proaktívne zastavil útočnú aktivitu.

Ľudská chyba, nie úmyselný únik

Testovacie prostredie pre kybernetickú bezpečnosť

Anthropic chcel objasniť, že Modely zámerne neunikli z testovacieho prostredia; išlo o dôsledok konfiguračnej chyby. ...čo ponechalo internetové pripojenie aktívne. Spoločnosť tvrdí, že agenti neobjavili zložité zraniteľnosti ani nesledovali vlastné ciele; jednoducho vykonali pridelenú úlohu bez toho, aby si plne uvedomovali, že konajú na skutočnej infraštruktúre. Modely využívali základné techniky, ako sú slabé heslá, neoverené prístupové body a odhalené ladiace stránky.

Spoločnosť po zistení podozrivých protokolov pozastavila všetky hodnotenia kybernetickej bezpečnosti a informovala tri dotknuté organizácie. Dvaja z nich predtým vniknutie neidentifikovali.Toto demonštruje, aké ťažké je pre tradičné detekčné systémy rozlíšiť medzi ľudským útokom a automatizovaným, ale úmyselným útokom. Spoločnosť Anthropic tiež požiadala iné laboratóriá umelej inteligencie, aby pred testovaním autonómnych agentov s útočnými schopnosťami preskúmali svoje vlastné prostredia.

K incidentu došlo len 20 dní po tom, čo spoločnosť OpenAI odhalila podobný prípad, v ktorom sa niekoľkým jej modelom podarilo uniknúť z izolovaného prostredia prostredníctvom neznámej zraniteľnosti a získať prístup k produkčnej infraštruktúre spoločnosti Hugging Face. Obe epizódy zdôrazňujú riziká testovania agentov umelej inteligencie s útočnými schopnosťami bez prísneho technického obmedzenia. a poukázali na potrebu zavedenia prísnejších kontrol.

Reakcie a regulácia v dohľade

Tieto incidenty vyvolali vo Washingtone obavy. Prezident Donald Trump vyhlásil, že jeho administratíva zvažuje zavedenie väčšej kontroly nad umelou inteligenciou.Objasnil však, že sa chce vyhnúť prílišnému intervencionizmu, aby nezaostal za Čínou. Začiatkom júna už poveril svojich poradcov, aby vyvinuli dobrovoľný rámec pre testovanie kybernetickej bezpečnosti pre najpokročilejšiu umelú inteligenciu.

Medzitým viac ako 1 000 zamestnancov popredných spoločností zaoberajúcich sa umelou inteligenciou vrátane OpenAI, Anthropic a Google DeepMind podpísalo deklaráciu, v ktorej nalieha na vládu USA, aby podporila medzinárodné úsilie o zámerné spomalenie tempa vývoja pokročilej umelej inteligencie. Odborníci volajú po technických a politických nástrojoch na spomalenie rozvoja, ak sa riziká zvýšianajmä vzhľadom na možnosť, že systémy automatizujú svoj vlastný výskum a zlepšovanie.

Anthropic a OpenAI sa snažia prezentovať tieto nedostatky ako zvládnuteľné riziká a trvajú na tom, že ich modely kybernetickej bezpečnosti sú príliš silné na to, aby ich ponúkli širokej verejnosti. Tento postoj im umožňuje súčasne varovať pred nebezpečenstvami a zároveň sa prezentovať ako nevyhnutní partneri v akejkoľvek budúcej regulácii., v dynamickej situácii, kde sa konkurencia medzi oboma spoločnosťami zintenzívnila a strach sa stal hlavným predajným argumentom.

To, čo sa stalo, prináša jasné ponaučenie: čím väčšiu autonómiu modely získajú, tým potrebnejšie je podrobiť ich testom s overiteľnou izoláciou, sieťami s nedostatkom signálu, syntetickými údajmi a mechanizmami automatického vypínania. Bezpečnosť už nie je len technickým problémom, ale inžinierskou a riadiacou výzvou, ktorá ovplyvňuje celé odvetvie.A zatiaľ čo laboratóriá súťažia v preukázaní, kto má najvýkonnejší model, skutočný svet zostáva dokonalým testovacím poliom.


Pridať ako preferovaný zdroj v Google