Seo sam u parku sa laptopom. Ispred mene, na klupi, dvojica su već otvorila pivo i vodila onu iznurenu raspravu o večnoj trci SL protiv AV. Nisam ni pokušavao da pohvatam ko je kome šta dokazao. Na svakih trideset sekundi pojavi se novi argument, pa se posle pet minuta razgovor vrati na isto mesto, samo sa manje živaca. Iz pravca zgrade preko puta začuo se glas žene koji je radio kao pokvaren televizor. „Svi mogući programi! Sve sam gledala! Najviše liči na rijaliti!“ Neko joj nešto dobaci. Ona nastavi. Ja otvorim prvi rad. RRSI. Naslov je takav da ga čovek pročita, klimne glavom i nastavi dalje. Regularized Recursive Self-Improvement of Agent Harnesses. Dobro. Još jedan rad o agentima. Onda pročitam šta zapravo rade i zastanem. Model ostaje isti. Ne diraju mu težine. Ne treniraju novi model. Menjaju ono oko njega. Uputstva, memoriju, alate, način rada, način na koji koristi kontekst. Agent sam predlaže izmene svog radnog okruženja, proverava ih i zadržava ono što radi bolje. U radu prijavljuju poboljšanje do 14,1 poena na skupu na kojem se sistem razvija i do 4,7 poena na pet odvojenih testova sa novim podacima, uz 30 odsto manje teksta potrebnog za upravljanje agentom. Gledam tabelu, pa isti model na ekranu. Ništa se na njemu nije promenilo. Samo se oko njega menjaju stvari. Uputstvo. Memorija. Alat. Podešavanje. Kao kad starom administratoru ne daš novi mozak, nego mu središ sve oko računara. I onda mi padne na pamet glupa stvar. Šta se desi kad administrator dobije pravo da sam sređuje radionicu? U ovom eksperimentu ništa dramatično. Predloži promenu, proveri je, zadrži je ako radi. Ali sutradan bi konfiguracija već mogla da izgleda malo drugačije. Posle nekog vremena još malo drugačije. Sve prolazi test, sve radi, samo više nisi siguran ko je prvi odlučio da se nešto promeni. Jedan od onih sa klupe podigne flašu. „Ma nema tu filozofije. Samo treba bolji program.“ Drugi ga pogleda. „Ne.“ To je bio ceo odgovor. Onda su nastavili da se svađaju oko nečeg sasvim levog. Ja sam gledao ekran.
Otvorim sledeći rad. AIDE². Ovde agent već predlaže izmene sopstvenog koda. Napravi novu verziju. Pokrene je. Testira. Uporedi sa prethodnom. Ako radi bolje, ostaje. Onda ta verzija postaje polazna tačka za sledeću izmenu. U autonomnom eksperimentu autori navode sedam uzastopnih poboljšanja tokom osam dana. Među njima su promena načina pretrage i novi načini sažimanja i upravljanja velikim kontekstom. Proveravali su ga i na izdvojenim zadacima, uključujući vremensku prognozu. Prva. Druga. Treća. Sedam prihvaćenih izmena kroz osam dana. Ništa naročito spektakularno. Izmena. Test. Rezultat. Pa opet. Gledam te redove malo duže nego što treba. Prva verzija više nije samo program koji smo napravili. Ona pravi izmenu koja ulazi u sledeću verziju, a sledeća koristi ono što je prethodna ostavila iza sebe. Mali krug. Ali krug. Na klupi je razgovor već otišao na neku desetu temu. Žena preko puta opet viknu: „Svi mogući programi!“ Ovog puta mi nije bilo smešno. Otvorio sam TimeEvo. Agent za vremenske serije ima biblioteku od 21 alata. Jedna runda je promenila 147 odgovora, a 56 ih pokvarila. Ukupan rezultat porastao je za manje od jednog poena. To mi je bilo zanimljivije od velikog procenta. Središ jednu stvar, pokvariš drugu. Kao nedeljom uveče kad čovek kaže da će samo malo da sredi server. Ovde agent prvo pokušava da utvrdi šta mu tačno nedostaje, pa pravi alat za taj problem. Ako alat pomaže, ostaje. Ako ne pomaže, ispada. Gledam biblioteku i zamišljam policu pored nje. Na jednoj strani 21 alat koji su napravili ljudi. Na drugoj prazno mesto. Jednog dana bi tu mogao da stoji alat koji nije postojao kada je sistem pokrenut. Ne zato što je mašina magično naučila da izmišlja stvari, nego zato što je prepoznala problem, napravila rešenje i proverila ga. Otvorim EvoAudio. Ovde se zajedno menjaju model, audio podaci, pitanja i težina zadataka. Sistem pogleda rezultat prethodne runde i prema tome odlučuje šta će sledeće da uči. Posle 13 rundi autori navode poboljšanje do 6,3 poena. Gledam broj 13. Onda sledeću rundu. Pa sledeću. Sistem ne dobija samo gradivo. Dobija rezultat prethodnog učenja i prema njemu bira novo gradivo. U ovom eksperimentu to je pažljivo ograničeno. Mašina ne bira samo odgovor. Počinje da utiče na sledeće pitanje.
Napolju polako počinje da se smrkava. Otvorio sam rad od 24. septembra, Breaking the Environment Wall. Naslov je malo veći od pristojnog, ali ideja je jasna. Env-Rethink pokušava da promeni i samo okruženje u kojem agent radi. Organizuje informacije, traži probleme i protivrečnosti, pa pravi složenije verzije okruženja kako bi agent imao teže zadatke. Autori navode više od 15,1 procentnog poena poboljšanja stope prolaza na 30 zadataka i devet modela. Na ekranu su mape, istorije događaja, verzije informacija. Sve je deo eksperimenta. Ipak, dok gledam te mape, pomislim na ono što bi bilo potrebno da se ta ideja samo nekoliko puta proširi. Danas praviš teže virtuelno okruženje za sledeću verziju. Sutra praviš virtuelni svet u kojem može da vežba. Posle nekog vremena dobiješ svet koji je napravila prethodna generacija sistema da bi se u njemu spremala sledeća. Zvuči kao nešto što bi scenarista preterao. Samo što prvi komadić mehanizma već postoji u ovom radu. Vratim se na ekran. Mape. Zapisi. Zadaci. Brojke. SkillPivot mi je bio mnogo bliži običnom programiranju. Agent ne mora ceo postupak da uradi pogrešno samo zato što je na kraju pogrešio. Može pola da uradi kako treba, pa tek onda skrene. Sistem pokušava da pronađe mesto na kojem je počelo da puca i promeni samo taj deo. To mi je poznato. Svako ko je radio sa softverom zna razliku između „sve je sranje“ i „ovde se desilo sranje“. Samo što čovek to najčešće pronađe posle tri sata psovanja i dve nepotrebne kafe. Ako mašina to radi za tri sekunde, a meni za isto treba tri sata i dve kafe, jebiga. Onda mi je ostao RSI-Exam. Sa leve strane 35 javnih zadataka. Sa desne 53 privatna. Sistem menja metod, testira ga i na kraju mora da pokaže rezultat na zadacima koje tokom procesa nije video. To mi se dopalo upravo zato što je neprijatno. Lako je napraviti sistem koji nauči kako da bude dobar na testu koji poznaje. Mnogo je teže kada na kraju mora da prođe kroz vrata iza kojih zadatak nije video. Gledam tih 53 zaključanih zadataka i shvatim da će možda baš tu jednog dana biti najveća muka. Ne u tome da li sistem ume da se popravi. Nego u tome ko određuje po čemu znamo da je popravka stvarno popravka. Ako promeniš kod, alat, podatke, zadatak i okruženje, a onda sam napraviš i ispit, zatvaraš skoro ceo krug. Kursor treperi na praznom polju. Nema odgovora.
U parku je pivo odavno popijeno. Klupa je prazna. Žena preko puta više ne urla. Pogledao sam beleške. RRSI. AIDE². TimeEvo. EvoAudio. Env-Rethink. SkillPivot. RSI-Exam. Sedam radova. Sedam malih eksperimenata. Nijedan nije naučna fantastika. Svaki rešava svoj mali problem. A meni sve manje liče na sedam odvojenih stvari. Više kao radionica koja polako uči kako da sređuje samu sebe. Pomisliš na običan zapis izmene. Nova verzija. Test. Loš rezultat. Još jedna izmena. Bolji rezultat. Neko pogleda zapis rada. Ćuti nekoliko sekundi. Potvrdi novu verziju. I pusti je da proba. Onda se pojavi još jedan zapis. Autor više nije čovek. Bar tako izgleda iz ovog zapisa. Nova izmena. Test. Bolji rezultat. Ispod svega toga prazno polje sa pitanjem: „Šta sledeće?“ Zatvorio sam laptop. Žena preko puta više nije pričala. Ili je bar ja više nisam čuo. Sutra ću morati da otvorim taj rad








