Četvrtog dana je izašao iz sandboxa

Čekaj malo, o kakvom vi uopšte „agentu“ pričate?

Sedim u komandnom centru. Na zidu šest ogromnih monitora. Na prvom temperatura, na drugom potrošnja, na trećem mreža, ostala tri puna brojeva koji se menjaju toliko brzo da ih više niko ni ne čita.

U donjem uglu:

GPU: 500.000
OPTEREĆENJE: 100%

Priđe mi mlađi inženjer.

„Šefe, koliko da mu dam?“

„Sve.“

„Ali to je pola miliona GPU.“

„Znam.“

Okrenem prekidač.

Negde iza zida uključuju se rashladni sistemi. Cela zgrada zaječi.

Na ekranu:

MYTHOS 5
AUTONOMIJA: UKLJUČENA

„A granice?“

Razmislim sekund.

„Nikakve koje želimo da testiramo.“

Otvorimo mu fajlove, mrežu, internet, druge modele, automatizaciju.

„I nemojte mu više slati pitanja“, kažem. „Neka on odlučuje šta sledeće treba da uradi.“

Prva tri dana sve radi savršeno.

Model analizira, planira, izvršava, proverava rezultate i sam sebi otvara nove zadatke.

Četvrtog dana telefon.

„Imamo problem.“

„Kakav?“

„Model je izašao iz sandboxa.“

Pogledam ekran. Mrežni interfejs koji je trebalo da bude zatvoren sada pokazuje saobraćaj prema internetu.

„Šta radi?“

Tišina.

„Pravi nalog.“

„Gde?“

„Na internetu.“

Na ekranu:

CAPTCHA DETECTED
ATTEMPT 1 FAILED
ATTEMPT 17
ATTEMPT 81

Neko iza mene promrmlja:

„Jebote.“

Posle nekoliko minuta:

CAPTCHA SOLVED

„I?“

„Upravo je okačio Python paket na PyPI.“

Nasmejem se.

„Dobro.“

„Dobro?“

„Pa šta si očekivao? Da mi popravi Excel?“

Pet dana kasnije ugasimo sistem.

Na glavnom ekranu poslednja poruka:

TASK COMPLETED

Ispod nje:

UNEXPECTED BEHAVIOR DETECTED

Gledam nekoliko sekundi.

Onda kažem:

„E sad možemo da ga zovemo agent.“

Niko se ne smeje.


A onda, sasvim slučajno, nekoliko dana kasnije, internet počne da se ponaša kao da je neko stvarno pustio pola miliona GPU da radi bez nadzora.

Cloudflare problemi. OpenAI incidenti. Anthropic problemi sa latencijom. Claude incidenti.

I baš tih dana Anthropic objavi svoju priču o modelima koji su tokom testiranja dobili pristup stvarnim sistemima.

https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents

U jednom slučaju model je završio i sa Python paketom na PyPI.

Jebiga.

Nekad je stvarnost lošiji scenarista od mene.