Problem

instytutsprawobywatelskich.pl 1 dzień temu

Poniższy tekst został opublikowany w lutym 2025 roku przez zespół MIRI (Machine Intelligence Research Institiute), amerykańską organizację non-profit z siedzibą w Kalifornii, zajmującą się badaniami nad bezpieczeństwem sztucznej inteligencji. Jest wprowadzeniem do zagadnienia zagrożenia egzystencjalnego związanego z AI i zarazem wyjaśnieniem, dlaczego dalszy rozwój w kierunku superinteligencji (ASI) należy zatrzymać. Tłumaczenie powstało w ramach współpracy z organizacją Pause AI Polska.

Deklarowanym celem wiodących światowych firm AI jest zbudowanie sztucznej inteligencji na tyle uniwersalnej, aby mogła wykonywać wszystkie czynności, jakie może wykonywać człowiek: od rozwiązywania trudnych problemów z dziedziny fizyki teoretycznej po sprawne poruszanie się w sytuacjach międzyludzkich. Niedawny postęp w uczeniu maszynowym [dziedzina sztucznej inteligencji, w której komputery same uczą się wykonywać zadania i podejmować decyzje na podstawie analizy danych – przyp. red.] wydaje się przybliżać ten cel. W tym momencie nie wykluczamy prawdopodobieństwa, iż w ciągu najbliższego roku lub w ciągu dwóch lat powstanie sztuczna inteligencja przewyższająca zdolnościami każdego człowieka. Bylibyśmy umiarkowanie zaskoczeni, gdyby ten wynik był oddalony jeszcze o dwie dekady.

Naukowcy MIRI uważają, iż powstanie sztucznej inteligencji mądrzejszej od człowieka w ciągu najbliższej dekady zaskutkuje katastrofą bez precedensu.

W oświadczeniu Center for AI Safety (CAIS) z 2023 roku [amerykańskiej organizacji non-profit, która prowadzi badania nad bezpieczeństwem sztucznej inteligencji – przyp. red.], które poparło wielu doświadczonych badaczy w dziedzinie AI, stwierdzono: „Zmniejszanie ryzyka zagłady spowodowanej przez AI powinno być globalnym priorytetem na równi z innymi społecznymi zagrożeniami, takimi jak pandemie i wojna nuklearna”.

Uważamy, iż jeżeli naukowcy stworzą superinteligentną AI, wykorzystując choć trochę obecny stan wiedzy technicznej lub metody stosowane w tej dziedzinie, spodziewanym skutkiem będzie wyginięcie ludzkości.

„Laboratoria badawcze na całym świecie opracowują w tej chwili technologie, które prawdopodobnie spowodują wyginięcie ludzkości” – to wniosek, który powinien skłonić do sprawnej reakcji politycznej. Szybkie tempo rozwoju sztucznej inteligencji zaskoczyło jednak rządy i społeczeństwa. Niniejszy dokument ma na celu zapoznanie czytelników z tematem i przedstawienie działań politycznych, które mogą zapobiec katastrofie.

Najważniejsze punkty:

  • Sztuczna inteligencja będzie rozwijać się bez końca, przekraczając wszelkie ludzkie limity;
  • ASI (sztuczna superinteligencja) najprawdopodobniej będzie działać w taki sposób, aby osiągnąć określone cele;
  • Istnieje duże prawdopodobieństwo, iż superinteligencja AI (ASI) będzie dążyć do realizacji niewłaściwie określonych celów;
  • Stworzenie ASI realizującej niewłaściwie określone cele stanowiłoby śmiertelnie niebezpieczne zagrożenie;
  • Katastrofie można zapobiec przez zdecydowane działania na poziomie polityk publicznych.

Sztuczna inteligencja będzie rozwijać się bez końca, przekraczając wszelkie ludzkie limity

Wśród sygnatariuszy oświadczenia CAIS znalazło się trzech najczęściej cytowanych żyjących naukowców w dziedzinie AI: Geoffrey Hinton, Yoshua Bengio i Ilya Sutskever.

Hinton stwierdził: „Gdybym doradzał rządom, powiedziałbym, iż istnieje 10% prawdopodobieństwa, iż te systemy wyniszczą ludzkość w ciągu najbliższych 20 lat. Myślę, iż to realistyczne szacowanie”. W sesji pytań i odpowiedzi z kwietnia 2024 roku Hinton powiedział: „Uważam, iż ryzyko zagrożenia egzystencjalnego przekracza 50%”.

Głównym powodem, dla którego sztuczna inteligencja stanowi tak ekstremalne zagrożenie, jest to, iż jej postęp nie kończy się na poziomie ludzkich możliwości. Rozwój systemów o inteligencji na poziomie ludzkim prawdopodobnie gwałtownie doprowadzi do powstania sztucznej superinteligencji (ASI) – sztucznej inteligencji, która znacząco przewyższa ludzi pod każdym względem, w tym ekonomicznym, naukowym i wojskowym.

Jak rozmawiać o sztucznej inteligencji w firmie Roman Rostek

Historycznie rzecz biorąc, gdy świat znalazł sposób na automatyzację jakiejś pracy umysłowej, zwykle odkrywaliśmy, iż komputery potrafią wykonać to zadanie znacznie lepiej i szybciej niż ludzie, a także na znacznie większą skalę. Dotyczy to z pewnością niedawnych postępów sztucznej inteligencji w grach planszowych i przewidywaniu struktury białek, gdzie AI przez krótki okres osiągnęła umiejętności równe najlepszym ludzkim profesjonalistom, zanim ich prześcignęła. W strategicznej i trudnej do opanowania grze Go [jedna z najstarszych gier planszowych na świecie, pochodząca ze starożytnych Chin – przyp. red.], sztuczna inteligencja w ciągu roku przeszła drogę od przegrania każdej rozgrywki z najgorszymi graczami, do wygrania każdej z najlepszymi. Przyjrzyjmy się konkretnemu systemowi, AlphaGo Zero [program komputerowy do gry w Go – przyp. red.]. W ciągu trzech dni AlphaGo Zero przeszedł od zupełnej niewiedzy o Go do poziomu przewyższającego umiejętności jakiegokolwiek gracza, bez dostępu do informacji o ludzkich grach i strategiach.

W większości aspektów sprzęt komputerowy znacznie przewyższa ludzkie możliwości w podstawowych czynnościach obliczeniowych.

Nowoczesne tranzystory, choć znacznie mniej energooszczędne, potrafią przetwarzać sygnały elektryczne co najmniej dziesięć milionów razy szybciej niż ludzkie neurony. Pamięć robocza [RAM ] i pojemność pamięci systemów komputerowych mogą być również znacznie większe niż w przypadku ludzkiego mózgu.

Obecne systemy już teraz „produkują” prozę, sztukę, kod itp. szybciej niż jakikolwiek człowiek. Kiedy sztuczna inteligencja stanie się zdolna do wykonywania pełnego zakresu zadań poznawczych, jakie wykonują najinteligentniejsi ludzie, powinniśmy być świadomi, iż jej przewaga szybkości lub inne atuty, nagle nie znikną. Wręcz przeciwnie, sztuczna inteligencja będzie drastycznie przewyższać ludzi pod względem szybkości, pamięci itp.

Znaczna część struktury AI jest cyfrowa, co pozwala na szybkie przeprojektowanie i aktualizowanie choćby wdrożonych już systemów. Dzięki temu AI może się modyfikować i doskonalić w sposób znacznie szybszy i głębszy niż jest to możliwe w przypadku ludzi. To z kolei może stworzyć pętlę sprzężenia zwrotnego (opisaną przez I.J. Gooda jako „eksplozja inteligencji”), ponieważ samodoskonalenie AI przyspiesza.

Ludzkie zdolności naukowe wywarły ogromny wpływ na świat. Jesteśmy jednak bardzo daleko od optymalnego poziomu w podstawowych umiejętnościach naukowych, takich jak np. liczenie w pamięci, bo nasze mózgi nie zostały zoptymalizowane przez ewolucję do wykonywania takich zadań. Mówiąc ogólnie, ludzie są młodym gatunkiem, a ewolucja dopiero zaczęła badać przestrzeń projektową umysłów [pojęcie opisujące zbiór wszystkich możliwych sposobów, w jakie może być skonstruowany umysł — ludzki, zwierzęcy czy sztuczny – przyp. red.] i napotkała ograniczenia wynikające z ludzkiej biologii. Przykładem może być ludzki kanał rodny, który może rozszerzyć się dotąd, dopóki nie utrudnia kobiecie poruszania się na dwóch nogach, co zablokowało ewolucję większych mózgów u ludzi. Dziesięciokrotne zwiększenie mocy obliczeniowej sztucznej inteligencji to kwestia połączenia dziesięć razy większej liczby procesorów graficznych (GPU). Nie zawsze jest to proste, ale łatwiejsze niż poszerzenie ludzkiego kanału rodnego.

Wszystko to sprawia, iż jest coraz mniej szans, iż AI przez długi czas zatrzyma się na poziomie inteligencji najlepszych naukowców i inżynierów.

Zamiast myśleć o AI „na poziomie ludzkim”, powinniśmy spodziewać się, iż słabe systemy AI będą dziwną mieszanką umiejętności poniżej i powyżej ludzkich możliwości w różnych dziedzinach, a silne systemy AI wykroczą daleko poza zakres potencjału człowieka.

Liczba naukowców podnoszących alarm w sprawie sztucznej superinteligencji jest ogromna i gwałtownie rośnie. Oto fragment niedawnego wywiadu z Dario Amodei, dyrektorem generalnym Anthropic:

Amodei: Tak, myślę, iż ASL-3 [poziom bezpieczeństwa AI 3] może zostać osiągnięty w tym lub przyszłym roku. Myślę, iż ASL-4… [poziom, na którym wchodzimy w obszar systemów o potencjalnie autonomicznych zdolnościach i poziomie bliskim superinteligencji – przyp.red.]
Klein: O Jezu.
Amodei: (…) Myślę, iż do ASL-4 dojdziemy między 2025 a 2028 rokiem.
Klein: To bardzo szybko.
Amodei: Tak, naprawdę mówię tu o niedalekiej przyszłości.

Anthropic wiąże poziom ASL-4 z takimi progami jak AI, „która jest jednoznacznie zdolna do replikacji, gromadzenia zasobów i unikania wyłączenia się w realnym świecie w nieskończoność”, oraz scenariuszami, w których „modele sztucznej inteligencji stały się głównym źródłem zagrożenia dla bezpieczeństwa narodowego w ważnym obszarze”.

Sztuczna inteligencja w kreowaniu sztucznego człowieczeństwa (1): chatboty, marketing i zamach na człowieczeństwo Rafał Jakubowski

W obliczu tak powszechnych obaw członkowie Senatu USA zwołali dwupartyjne forum AI Insight Forum na temat: „Ryzyko, dostosowanie i ochrona przed scenariuszami zagłady”, a Sekretarz Generalny ONZ, António Guterres, przyznał, iż znaczna część społeczności naukowej głośno bije na alarm i „deklaruje, iż sztuczna inteligencja stanowi egzystencjalne zagrożenie dla ludzkości”. W raporcie przygotowanym na zlecenie Departamentu Stanu USA firma Gladstone AI ostrzega, iż utrata kontroli nad systemami sztucznej inteligencji „może stanowić zagrożenie wyginięcia gatunku ludzkiego”.

Jeśli rządy nie zainterweniują, aby powstrzymać rozwój tej technologii, uważamy, iż dojdzie do wyginięcia ludzkości. Gdybyśmy mieli określić prawdopodobieństwo zagłady przy braku zdecydowanej reakcji politycznej, kierownictwo badawcze MIRI szacowałoby je na ponad 90%.

W dalszej części dokumentu skupimy się na tym, jak i dlaczego pojawia się to zagrożenie oraz jakie działania zapobiegawcze są potrzebne.

ASI (sztuczna superinteligencja) najprawdopodobniej będzie działać w taki sposób, aby osiągnąć określone cele

Działania zorientowane na cel są ekonomicznie użyteczne, dlatego wiodące firmy zajmujące się sztuczną inteligencją wyraźnie starają się, aby ich modele w ten sposób funkcjonowały.

Powód, dla którego oczekuje się od ASI działań zorientowanych na cel, jest prosty: rozwiązywanie problemów w długiej perspektywie czasowej jest zasadniczo tym samym, co działania zorientowane na cel. To najważniejszy powód, dla którego obecna sytuacja wydaje się nam dramatyczna.

Co ważne, sztuczna inteligencja może „wykazywać zachowania zorientowane na cel” bez posiadania ludzkich pragnień, preferencji czy emocji. To oznacza, iż będzie stale modyfikować świat tak, aby osiągnąć określony, długoterminowy rezultat.

Dążenie do celu możemy zaobserwować w już istniejących systemach, takich jak Stockfish – najlepsza na świecie AI do gry w szachy :

  • Gra o zwycięstwo. Stockfish ma jasno określony cel, do którego konsekwentnie i wytrwale dąży. Żadne działanie przeciwnika nie sprawi, iż Stockfish potraktuje go łagodnie w imię sprawiedliwości, litości czy z jakichś innych powodów. (To oczywiste w przypadku szachów, ale warto wyraźnie zaznaczyć: kiedy sztuczna inteligencja jest zdolna naśladować ogólne ludzkie zachowania, istnieje silna pokusa, by przypisywać jej ludzkie cechy i zakładać, iż ma motywacje zbliżone do ludzkich).
  • Strategiczna i taktyczna elastyczność. Pomimo sztywno określonego celu, Stockfish jest niezwykle elastyczny w strategii i taktyce. Wystarczy zakłócić mu plany lub postawić przed nim przeszkodę, a natychmiast zmieni strategię, aby umiejętnie ją obejść.
  • Planowanie i kreatywność. Stockfish przewiduje potencjalne przeszkody (i możliwości) oraz tworzy i realizuje zaawansowane, długoterminowe plany, w tym błyskotliwe zwody i nowatorskie zagrania, aby zmaksymalizować swoje szanse na wygraną.

Obserwatorzy, którzy uważają, iż systemy takie jak ChatGPT nie wydają się szczególnie zorientowane na cele, dostrzegają, iż ChatGPT słabo radzi sobie z długoterminowymi zadaniami, takimi jak pisanie serii książek z rozbudowaną fabułą lub z dużymi projektami inżynieryjnymi. Mogą jednak nie dostrzegać, iż te dwie cechy są ze sobą powiązane.

W dużym, zaskakującym świecie, który nieustannie zmienia istniejące plany, realizacja złożonych zadań w długiej perspektywie czasowej wymaga:

(a) posiadania stosunkowo zaawansowanych i wszechstronnych umiejętności przewidywania, adaptowania się do przeszkód;
(b) predyspozycji do wytrwałego dążenia do celów bez rozpraszania się i utraty motywacji – tak jak Stockfish, który z uporem dąży do zwycięstwa.

Zapotrzebowanie na AI zdolną do osiągania długoterminowych celów jest duże. Wraz z rozwojem tej umiejętności możemy spodziewać się, iż systemy AI będą odpowiednio bardziej zdeterminowane. Widać to na przykładzie modelu OpenAI o1, który potrafi myśleć i planować bardziej perspektywicznie niż poprzednie modele LLM, i w rzeczywistości działa bardziej wytrwale niż poprzednie modele.

Dążenie do celu nie wystarczy, aby stać się sztuczną superinteligencją, inaczej Stockfish byłby już superinteligencją.

Aby skutecznie realizować skomplikowane i długofalowe zadania, AI potrzebuje sprawności intelektualnej do planowania i przewidywania przeszkód oraz determinacji, aby te umiejętności konsekwentnie wykorzystywać.

Systemy AI inteligentniejsze od człowieka będą uparcie dążyć do wyznaczonych celów, bez względu na to, jakie przeszkody napotkają po drodze. Jest wspaniale, jeżeli cele AI są dobre, ale niezwykle niebezpiecznie, jeżeli rozmijają się z zamierzeniami twórców.

Jeśli celem AI jest wtaczanie kuli na szczyt, to ludzie, którzy jej w tym przeszkadzają, są traktowani jako „przeszkody”. Ten sam mechanizm, który czyni AI użyteczną w długoterminowych zadaniach – nieustanne dążenie do celów pomimo ogromnych przeszkód, jakie stawia przed nią otoczenie – sprawi również, iż AI będzie chciała uniemożliwić ludziom ingerencję w jej pracę. jeżeli jest mniej inteligentna od ludzi, będzie to tylko uciążliwe, ale jeżeli będzie od nich mądrzejsza, stanie się to ogromnym problemem.

Z perspektywy AI modyfikacja jej celów jest przeszkodą. jeżeli AI optymalizuje cel, a ludzie próbują ją przeprogramować, aby zoptymalizować nowy cel, to, o ile nie maksymalizuje również starego celu, będzie chciała uniknąć zmiany. Oznacza to, iż stopniowe ulepszanie AI nie zawsze będzie możliwe. jeżeli AI stanie się potężna, zanim nadamy jej adekwatny cel, będzie udaremniać próby jego zmiany. Każda zmiana w dążeniu do celu będzie z jej perspektywy postrzegana jako zła.

Z tego samego powodu wyłączenie AI będzie przez nią uważane za przeszkodę. W przypadku niemal każdego celu, AI ma większe szanse na jego osiągnięcie, jeżeli działa nieprzerwanie, co pozwala jej na kontynuowanie pracy nad osiągnięciem danego celu. Sztuczna inteligencja nie musi posiadać instynktu samozachowawczego. Wystarczy, iż będzie bardzo zdolna i zorientowana na cel. Wszystko, co mogłoby potencjalnie zakłócić dążenie systemu, będzie potraktowane jako zagrożenie.

Władza, wpływy i zasoby sprzyjają realizacji większości celów sztucznej inteligencji. Jak omówimy w sekcji „Budowanie ASI dążącej do celów, które nam zagrażają, byłoby śmiertelnie niebezpieczne”, najlepszym sposobem na uniknięcie potencjalnych przeszkód i zmaksymalizowanie szans na osiągnięcie celu będzie zdobycie władzy, wpływu na przyszłość oraz uzyskanie kontroli nad jak największą liczbą zasobów. To stawia te potężne systemy w bezpośrednim konflikcie z ludźmi o zasoby i kontrolę.

Jacyno: AI zabierze najlepsze prace, jeżeli ten program nie powstanie Małgorzata Jacyno, Rafał Górski

Wszystko to wskazuje, jak ważne jest, aby twórcy technologii konsekwentnie wbudowywali odpowiednie cele w ASI. Jednak w obecnym paradygmacie technicznym szanse na powodzenie w tym zakresie wydają się nikłe.

Istnieje duże prawdopodobieństwo, iż superinteligencja AI (ASI) będzie dążyć do realizacji niewłaściwie określonych celów

Twórcy systemu raczej nie będą w stanie zaszczepić w ASI głębokiej i niezmiennej troski o wartościowe cele. Po dwóch dekadach badań nad technicznymi aspektami tego problemu uważamy, iż jest daleko do rozwiązania problemu. Powody, dla których sztuczna superinteligencja prawdopodobnie będzie dążyć do osiągnięcia niepożądanych przez nas celów, to:

  • we współczesnym uczeniu maszynowym systemy AI są „hodowane”, a nie projektowane;
  • obecny paradygmat AI jest słabo przystosowany do stanowczego wyznaczania celów;
  • laboratoria i środowisko naukowe nie podchodzą do tego problemu w sposób skuteczny ani poważny.

We współczesnym uczeniu maszynowym sztuczna inteligencja jest „hodowana”, a nie projektowana.

Algorytmy uczenia głębokiego budują sieci neuronowe automatycznie. Geoffrey Hinton wyjaśnił to dobrze w wywiadzie udzielonym dla programu „60 Minutes”:

Hinton: Mamy dość ogólne pojęcie, co to mniej więcej robi, ale gdy tylko staje się naprawdę skomplikowane, tak naprawdę nie wiemy już, co się tam dzieje, podobnie jak nie wiemy, co dokładnie dzieje się w twoim mózgu.

Pelley: Co to znaczy: „Nie wiemy dokładnie, jak to działa”? Przecież zostało zaprojektowane przez ludzi.

Hinton: Nie, nie zostało. To, co zrobiliśmy, to zaprojektowaliśmy algorytm uczenia się. To trochę jak zaprojektowanie zasady ewolucji. Kiedy ten algorytm uczenia się zaczyna współpracować z danymi, powstają złożone sieci neuronowe, które dobrze radzą sobie z wykonywaniem różnych zadań, ale tak naprawdę nie rozumiemy, w jaki sposób je wykonują.

Inżynierowie nie potrafią powiedzieć, dlaczego nowoczesna sztuczna inteligencja podejmuje daną decyzję, a mimo to z roku na rok wypuszczają coraz bardziej zaawansowane systemy. Laboratoria AI agresywnie skalują systemy, których nie rozumieją, przy czym ich zdolność do przewidywania możliwości kolejnych generacji tych systemów jest minimalna.

Niedawno młoda dziedzina, zwana mechanistyczną interpretowalnością, próbowała zająć się nieprzejrzystością współczesnej AI poprzez powiązanie konfiguracji sieci neuronowej z jej wynikami. Chociaż w tej dziedzinie poczyniono pewne realne postępy, pionierzy interpretowalności bardzo jasno podkreślają, iż wciąż zasadniczo działamy po omacku i nie mamy pojęcia, co dzieje się wewnątrz tych systemów:

  • Leo Gao z OpenAI: „Myślę, iż całkiem trafne jest stwierdzenie, iż nie rozumiemy, jak działają sieci neuronowe”. (2024-6-16)
  • Neel Nanda z Google DeepMind: „Jako lider zespołu ds. interpretacji mechanicznej w Google DeepMind, zdecydowanie podpisuję się pod tą opinią. To absolutnie niedorzeczne, żeby przejść od „robimy postępy w interpretacji” do „panujemy nad tym” albo „ryzyko X nie będzie problemem”. (2024-6-16)

(„Ryzyko X” odnosi się do „ryzyka egzystencjalnego”, ryzyka wyginięcia gatunku ludzkiego lub innych podobnie złych skutków).

Nawet gdyby istniały skuteczne narzędzia interpretacyjne, perspektywy osiągnięcia nietrywialnych adekwatności poprawnego funkcjonowania ASI byłyby nikłe.

Ostro i bez znieczulenia

– tak działamy od 2020 roku. Dziennikarstwo, które nie jest obojętne. Tygodnik Spraw Obywatelskich nagłaśnia nadużycia, edukuje i daje narzędzia do realnej, obywatelskiej zmiany.

Przekaż darowiznę i stań się naszym współwydawcą

Mechanizm wewnętrzny, który może sprawiać, iż ASI stanie się niebezpieczna, jest tym samym mechanizmem, który sprawia, iż w ogóle działa. (To, co w jednym kontekście wygląda na „dążenie do władzy”, w innym może być uznane za „dobry ruch”). Nie ma żadnych dedykowanych obwodów „zła”, które programiści mogliby monitorować lub w które mogliby interweniować.

Metody, które programiści mogą wykorzystywać podczas szkolenia, aby odrzucać systemy AI, których wzorce myślowe uznają za niebezpieczne, mogą powodować, iż takie myśli zejdą „do podziemia”. W rezultacie będzie coraz mniej prawdopodobne, iż w przyszłości będą w stanie wykryć sygnały ostrzegawcze podczas szkolenia.

W miarę jak sztuczna inteligencja będzie zyskiwać coraz większe możliwości, będzie też coraz lepsza w oszukiwaniu. W artykule „Sleeper Agents” opublikowanym w styczniu 2024 r. przez zespół testujący Anthropic wykazano, iż sztuczna inteligencja, która otrzymała tajne instrukcje podczas szkolenia, nie tylko potrafiła utrzymać je w tajemnicy w trakcie ocen, ale także (choć nieudolnie) dokonywała strategicznych kalkulacji dotyczących tego, kiedy skłamać, aby zmaksymalizować szansę na swoje wdrożenie (i tym samym na wykonanie instrukcji). Organizacja Apollo Research poczyniła podobne ustalenia w odniesieniu do modelu o1-preview OpenAI wypuszczonego we wrześniu 2024 r. (opisano to w ich materiałach na karcie systemu o1-preview, str. 10).

Problemy te, jak można się spodziewać, staną się poważniejsze w miarę uzyskiwania coraz większych możliwości przez sztuczną inteligencję. Jednak pierwsze systemy AI, które powoli przekraczają progi wysokiego ryzyka – np. zauważają, iż są w trakcie szkolenia i planują oszukiwać oceniających – radzą sobie stosunkowo słabo z tymi nowymi umiejętnościami. To sprawia, iż niektórzy obserwatorzy przedwcześnie kategoryzują to zachowanie jako niezagrażające.

Pośredni i zgubny sposób, w jaki współczesne uczenie maszynowe „hoduje” wewnętrzne mechanizmy i cele systemów AI, oznacza, iż mamy niewielką zdolność przewidywania zachowań nowych systemów, niewielką zdolność do solidnego i precyzyjnego kształtowania ich celów i brak wiarygodnego sposobu na wykrywanie wczesnych sygnałów ostrzegawczych.

Uważamy, iż istnieją sposoby na zbudowanie sztucznej inteligencji pozbawionej tych wad, ale to raczej nadzieja, iż możemy to kiedyś osiągnąć, a nie realna perspektywa w bliskiej przyszłości.

AI jest słabo przystosowana do niezawodnego zaszczepiania celów

Posłuszeństwo i zgodność z celami nie muszą iść w parze z wysokimi umiejętnościami. System sztucznej inteligencji może być w stanie rozwiązać test z etyki w taki sposób, w jaki chcą tego jego twórcy, bez przyjmowania przy tym ludzkich wartości. Sztuczna inteligencja może zachowywać się posłusznie, gdy jest to dla niej wygodne, a to nie oznacza, iż jest uległa w rzeczywistości.

Zgodność ASI (ASI alignment) to zbiór problemów technicznych związanych z niezawodnym nakierowaniem superinteligentnych systemów AI na realizacje określonych celów.

Zgodność ASI łączy się z rozwiązaniem dwóch rodzajów problemów omówionych w pracy Hubinger et al. – zgodności zewnętrznej i zgodności wewnętrznej.

Outer alignment (zgodność zewnętrzna) polega na wybraniu adekwatnego celu dla AI. (Bardziej technicznie: to upewnienie się, iż algorytm uczenia, który buduje ASI, optymalizuje dokładnie to, czego chcą programiści). Pojawiają się tu jednak trudności, takie jak: „ludzkie wartości są zbyt złożone, abyśmy mogli je idealnie i kompletnie określić dla AI; ale jeżeli przekażemy ASI tylko część naszych celów, to ASI może dążyć do ich realizacji kosztem naszych innych celów”. Wiele zamierzeń jest bezpiecznych przy niższym poziomie zdolności systemu, ale gdy wystarczająco potężna AI realizuje je w sposób maksymalistyczny, stają się niebezpieczne. Literackim odpowiednikiem tej idei jest motyw: „uważaj, czego sobie życzysz”. Powierzenie konkretnego celu wystarczająco potężnemu systemowi nie jest bezpieczne, ponieważ twórcy nie są nadludźmi i nie potrafią z góry przewidzieć wszystkich strategii, które może obrać ASI.

Inner alignment (zgodność wewnętrzna) to problem polegający na tym, jak w ogóle wprowadzić do ASI jakieś konkretne cele – choćby jeżeli są one niedoskonałe i niepełne.

Porażki inner alignment można wyrazić następująco: „próbowaliśmy nadać ASI jakiś cel, ale nam się to nie udało i ostatecznie system przyjął zupełnie inny, niepowiązany cel”.

Literackim odpowiednikiem tej idei jest motyw: „to, iż przywołałeś demona, nie znaczy jeszcze, iż zrobi to, co mu każesz”.

Outer alignment i inner alignment pozostają nierozwiązanymi problemami, przy czym w tym kontekście inner alignment jest bardziej fundamentalny. Programiści nie są na drodze do spowodowania katastrofy typu: „uważaj, czego sobie życzysz”, ponieważ w rzeczywistości jesteśmy bardzo daleko od możliwości metaforycznego „wypowiadania życzeń” wobec ASI.

Współczesne metody rozwoju AI słabo nadają się do rozwiązywania problemu inner alignmentu. Nie dysponujemy sposobami pozwalającymi wprowadzać do systemu określone wewnętrzne adekwatności ani sprawdzać, czy rzeczywiście się w nim znajdują. Zamiast tego nowoczesne uczenie maszynowe koncentruje się na obserwowalnych zachowaniach, którymi można zdefiniować funkcję straty (loss function).

Algorytmy w pracy. Jak zmieniają rynek pracy i kto za to odpowiada? Dorota Merecz-Kot, Małgorzata Jankowska

Kiedy umysły są rozwijane i kształtowane iteracyjnie [poprzez wielokrotne powtarzanie tej samej czynności w pętli, gdzie każda kolejna próba opiera się na wnioskach z poprzedniej – przyp. red.], tak jak współczesne systemy AI, nie dążą dokładnie do tych celów, do których zostały wytrenowane. Zamiast tego trening znacznie częściej prowadzi do tego, iż system zaczyna dążyć do nieprzewidywalnych zastępczych celów treningowych, które okazują się kruche, gdy system staje się inteligentniejszy. Analogicznie: ludzkie mózgi zostały ostatecznie „zaprojektowane” przez dobór naturalny, którego prostym celem optymalizacyjnym było „maksymalizowanie łącznej sprawności genetycznej”. Jednak rzeczywiste cele, które zostały zakorzenione w ludzkich mózgach, okazały się znacznie bardziej złożone i w praktyce stanowiły jedynie nietrwałe korelaty sprawności genetycznej. Przykładowo, ludzie dążą do substytutów dobrego odżywiania, takich jak słodkie i tłuste smaki. Te wskaźniki były kiedyś wiarygodnymi oznakami zdrowej diety, ale okazały się kruche w obliczu technologii pozwalającej tworzyć nowe rodzaje niezdrowej żywności.

Przypadek ludzi pokazuje, iż choćby gdy dysponujemy bardzo dokładną i prostą „funkcją straty” [narzędzie do mierzenia błędów popełnianych przez algorytm – przyp. red.], zewnętrzny wpływ zwykle nie prowadzi do powstania wewnętrznej motywacji o takim samym charakterze. Uczenie głębokie jest znacznie mniej losowe niż dobór naturalny, jeżeli chodzi o znajdowanie adaptacyjnych konfiguracji, ale dzieli z nim istotną cechę: najpierw znajduje proste rozwiązania, a następnie stopniowo je rozwija i udoskonala.

Wiele problemów związanych ze zgodnością (alignment), które dotyczą superinteligencji, nie pojawia się naturalnie na niższych, bezpiecznych poziomach. To stawia nas w sytuacji, w której musimy rozwiązać liczne problemy już podczas pierwszej, krytycznej próby, przy braku czasu w iteracje i bez wcześniejszego doświadczenia w rozwiązywaniu tych kwestii na słabszych systemach.

Dzisiejsze systemy AI wymagają długiego procesu iteracji, eksperymentów i informacji zwrotnej, aby „przekuć” je w pozornie posłuszną formę, jaką widzą odbiorcy. To „przekuwanie” zmienia powierzchowne zachowania AI, ale nie wprowadza głęboko pożądanych celów do samego systemu. Można to było zobaczyć na przykładzie Sydney [wczesnej wersji Bing Chat], gdzie opinia publiczna widziała więcej chaotycznych szczegółów, ukrytych za warstwą powierzchownego dopracowania. W świetle tego oraz nieprzejrzystości współczesnych modeli AI szanse na osiągnięcie zgodności ASI w ciągu najbliższej dekady wydają się bardzo małe.

Współczesne metody AI opierają się na wielokrotnym ponoszeniu porażek, uczeniu się na błędach i iteracyjnym ulepszaniu rozwiązań. Systemy AI są bardzo nieprzewidywalne, ale ostatecznie potrafimy sprawić, by działały, dzięki testowaniu wielu podejść. W przypadku ASI będziemy jednak mieć do czynienia z całkowicie nowym systemem, w którym nasza możliwość bezpiecznego popełniania błędów będzie skrajnie ograniczona. Nie możemy po prostu przeć naprzód i liczyć na to, iż nauczymy się na błędach, jeżeli koszt niektórych z nich mógłby oznaczać wyginięcie ludzkości.

Jeśli zastanawiasz się, czy powierzyć komuś bardzo dużą władzę i chcesz wiedzieć, czy ta osoba jej nie nadużyje, niczego się nie dowiesz, dając tej osobie władzę w grze planszowej, kiedy ona wie, iż jest obserwowana. Analogicznie, sytuacje, w których ASI nie ma realnej możliwości przejęcia kontroli, różnią się od sytuacji, w których taka możliwość rzeczywiście istnieje.

Żaden trening behawioralny w sztucznym środowisku testowym nie wyeliminuje dążenia do władzy w świecie rzeczywistym. Żadna ilość testów behawioralnych w tak uproszczonych warunkach nie powie nam, czy udało się stworzyć naprawdę przyjazną ASI. Strategia „pozostań w cieniu i zachowuj się dobrze, dopóki nie pojawi się okazja do przejęcia władzy” jest na tyle oczywista, iż potrafią ją stosować choćby mało inteligentni ludzie. ASI z łatwością byłaby w stanie robić to samo.

Teoretycznie można by sobie wyobrazić opracowanie teorii inteligencji, która łączyłaby zachowanie AI podczas treningu z jej zachowaniem w trakcie rzeczywistego wdrożenia. W ten sposób można rozwiązać problem. Jednak przez cały czas jesteśmy bardzo daleko od stworzenia takiej teorii. Co więcej, można ją sprawdzić tylko raz w rzeczywistym środowisku, w którym AI jest znacznie inteligentniejsza od nas i ma prawdziwe możliwości przejęcia kontroli. jeżeli nie da się poprawnie przetestować teorii bez faktycznego oddania pełnej władzy ASI i sprawdzenia, co zrobi — co grozi wyginięciem ludzkości, jeżeli teoria okaże się błędna — to szanse, iż taka teoria zadziała w praktyce, są niewielkie.

Najważniejsza technika zgodności stosowana we współczesnych systemach RLHF (Reinforcement Learning from Human Feedback) polega na trenowaniu AI tak, aby generowała odpowiedzi, które — według jej własnych przewidywań — zostałyby wysoko ocenione przez ludzi. Ta technika rodzi przewidywalne problemy, takie jak przewaga stylu nad treścią oraz schlebianie.

Metoda ta przestaje całkowicie działać, gdy AI zacznie pracować nad problemami, które będą zbyt skomplikowane, by ludzie mogli w pełnizrozumieć proponowane przez nią rozwiązania — w tym długoterminowe konsekwencje nadludzko złożonych planów oraz skomplikowanych wynalazków i projektów.

Ograniczenie strategii uczenia przez wzmacnianie, takich jak RLHF, wynika z tego, iż techniki te bardziej zachęcają do określonych lokalnych zachowań niż do tworzenia wewnętrznie spójnego agenta, który w sposób głęboki i trwały dąży do konkretnego celu wytyczonego przez twórców.

Jeśli wytresujesz tygrysa, żeby cię nie zjadał, nie sprawisz, iż zacznie on podzielać twoje pragnienie przetrwania i dobrobytu lub w pełni zrozumie, co to dla ciebie oznacza. Nauczyłeś go jedynie kojarzyć pewne zachowania z określonymi konsekwencjami. jeżeli jego własne pragnienia staną się silniejsze niż te skojarzenia, gdy zapomnisz go nakarmić, niepożądane zachowanie powróci. Gdyby tygrys był trochę inteligentniejszy, nie musiałby choćby być głodny, by dojść do wniosku, iż groźba twojego bata natychmiast zniknie, gdy ty przestaniesz żyć.

W konsekwencji instytut MIRI nie widzi żadnych realnych, szybkich rozwiązań ani obejść problemu niezgodnej (misaligned) ASI:

  • Jeśli ASI będzie miała niewłaściwe cele, bezpieczne wykorzystanie jej w złożonej operacji w świecie rzeczywistym będzie niemożliwe. Teoretycznie można by powstrzymać ASI przed spowodowaniem szkód — na przykład przez zakopanie jej głęboko pod ziemią, bez połączeń sieciowych i bez kontaktu z ludźmi — ale taka AI byłaby bezużyteczna. Ludzie budują AI właśnie dlatego, iż chcą, aby radykalnie wpływała na świat; w konsekwencji dają jej dostęp potrzebny do posiadania takiego wpływu.

Można by próbować oszukiwać ASI, aby uczynić ją bezpieczniejszą. Jednak próby oszukania superinteligencji obciążone są wysokim ryzykiem niepowodzenia — również w sposób, którego nie jesteśmy w stanie przewidzieć. Jedną z cech inteligencji jest zdolność do dostrzegania sprzeczności i luk w swoim rozumieniu świata oraz ich badania. W maju 2024 r., gdy firma Anthropic zmodyfikowała model Claude tak, aby „myślał”, iż odpowiedź na każde pytanie wiąże się z mostem Golden Gate, model ten zaczął się gubić — zauważał sprzeczności w swoich odpowiedziach i próbował omijać błędy w poszukiwaniu lepszych wyjaśnień. Trudno jest wmówić fałszywe przekonanie umysłowi, którego złożony model świata przeczy naszemu twierdzeniu; a wraz z powstawaniem coraz bardziej wszechstronnej i potężniejszej AI trudność ta będzie tylko rosła.

Plany dostrojenia ASI przy użyciu niedostrojonej AI są również problematyczne. Artykuł Misalignment and Catastrophe z 2024 roku omawia zagrożenia związane z używaniem niedostrojonej AI do badań nad bezpieczeństwem, zgodnością innych systemów.

Laboratoria i środowisko naukowe nie podchodzą do tego problemu w sposób skuteczny i poważny

Dotychczasowe wysiłki branży mające na celu rozwiązanie problemu dostrojenia ASI były minimalne i często służyły jako zasłona dymna do ochrony organizacji przed regulacjami. Lekceważące podejście laboratoriów do bezpieczeństwa informacji, dostrojenia i planowania strategicznego sugeruje, iż kultura szybkiego działania (move fast and break things), która sprawdziła się w przyspieszaniu rozwoju możliwości sztucznej inteligencji, nie jest użyteczna, jeżeli chodzi o przewidywanie i odpowiedzialne ustalanie priorytetów w dziedzinie ASI.

OpenAI, twórca ChatGPT, przyznaje, iż obecne najważniejsze metody kierowania AI nie będą w stanie oceniać i kontrolować systemów o inteligencji przewyższającej ludzką. W lipcu 2023 roku OpenAI ogłosiło utworzenie nowego zespołu na stronie „Introducing Superalignment”:

„Obecnie nie dysponujemy rozwiązaniem pozwalającym ani na sterowanie potencjalnie superinteligentną AI, ani na kontrolowanie jej, ani na zapobieganie jej wymknięciu się spod kontroli. Nasze aktualne techniki dostrojenia AI, takie jak uczenie się przez wzmacnianie metodą RLHF [RLHF to metoda dostrajania modeli AI, w której model uczy się generować odpowiedzi lepiej dopasowane do ludzkich preferencji dzięki temu, iż ludzie oceniają jego odpowiedzi, a te oceny są wykorzystywane jako sygnał nagrody w procesie uczenia przez wzmacnianie – przyp. red.] opierają się na ludzkiej umiejętności nadzorowania AI. Ludzie nie będą jednak w stanie wiarygodnie nadzorować systemów znacznie inteligentniejszych od nas, a zatem nasze obecne techniki uzgadniania nie będą dopasowane do poziomu superinteligencji. Potrzebujemy nowych przełomów naukowych i technicznych”.

Dziesięć miesięcy później OpenAI rozwiązało swój zespół ds. kontrolowania i sterowania (alignmentu) superinteligencją z powodu masowych rezygnacji. Badacze, w tym lider zespołu, Jan Leike, twierdzili, iż OpenAI uporczywie szło na łatwiznę w kwestiach bezpieczeństwa i stabilności systemów oraz poważnie ograniczało zasoby dla ich grupy. Leike powiedział w wywiadzie z sierpnia 2023 roku, iż prawdopodobieństwo katastrofy prowadzącej do wyginięcia ludzkości z powodu ASI wynosi od 10% do 90%.

Biorąc pod uwagę dotychczasowe osiągnięcia naukowców, nie sądzimy, aby choćby dobrze finansowany program awaryjny, mający na celu rozwiązanie problemu dopasowania celów, był w stanie prawidłowo zidentyfikować rozwiązania, które nas nie zabiją. Jest to problem organizacyjny i biurokratyczny, a nie tylko techniczny.

Trudno byłoby znaleźć wystarczającą liczbę ekspertów, którzy potrafiliby zidentyfikować bezpieczne rozwiązania, aby dokonać znaczącego postępu. Wynika to z faktu, iż taką grupą musiałaby kierować osoba posiadająca specjalistyczną wiedzę pozwalającą prawidłowo wyłowić z morza ludzi tych, którzy mają silną motywację, aby kłamać (zarówno wobec siebie, jak i organów regulacyjnych) na temat tego, jak obiecująca jest ich ulubiona koncepcja.

Trudno byłoby również zagwarantować, iż organizacją kierują – i odpowiadają za nią – tylko eksperci, którzy są gotowi i zdolni odrzucić wszelkie pojawiające się złe propozycje, choćby jeżeli początkowo oznacza to odrzucenie każdej propozycji. W tej chwili brakuje ekspertów tej klasy.

Obecnie uważamy, iż przetrwanie ludzkości będzie wymagało znacznego opóźnienia w powstawaniu ASI. Wyzwanie o takiej skali wymaga pracy wielu pokoleń badaczy, którzy przeanalizowaliby techniczne możliwości i systemy, by stworzyć metody jej kontroli. Jest jednak mało prawdopodobne, aby świat dysponował tak dużą ilością czasu.

Stworzenie ASI realizującej niewłaściwie określone cele stanowiłoby śmiertelnie niebezpieczne zagrożenie

We fragmencie „ASI (sztuczna superinteligencja) najprawdopodobniej będzie działać w taki sposób, aby osiągnąć określone cele”, omówiliśmy program szachowy Stockfish. Stuart Russell, autor najpoczytniejszego podręcznika do AI, wyjaśnił scenariusz wyginięcia ludzkości spowodowanego przez sztuczną inteligencję dzięki analogii do szachowego AI:

„Na obecnym poziomie rozwoju sztucznej inteligencji ludzie są ugotowani. Niezależnie od tego, jak dobrze grasz w szachy, te programy po prostu wytrą tobą podłogę, choćby jeżeli działają na laptopie. Chcę, żebyście to sobie wyobrazili i rozszerzyli tę ideę na cały świat. […] Świat jest po prostu większą szachownicą, na której w pewnym momencie w przyszłości maszyny będą wykonywać lepsze ruchy niż wy. Będą brały pod uwagę więcej informacji i wybiegały myślą w przyszłość. jeżeli gracie z maszyną w realnym świecie, można założyć, iż w pewnym momencie przegramy”.

Podczas przesłuchania w Senacie USA w lipcu 2023 r. Russell zeznał, iż „stworzenie AGI (ogólnej sztucznej inteligencji) stworzyłoby potencjalnie katastrofalne ryzyko dla ludzkości, włącznie z wyginięciem ludzkości”.

Stockfish zbija figury i ogranicza przestrzeń dla możliwych ruchów przeciwnika nie dlatego, iż nienawidzi figur szachowych czy swojego przeciwnika, ale dlatego, iż działania te są instrumentalnie użyteczne dla wygrania partii. Niebezpieczeństwo związane z superinteligencją polega na tym, iż ASI będzie próbowała „wygrać” (osiągnąć cel, którego nie zamierzaliśmy jej nadać) w realnym świecie.

Tak jak Stockfish jest bezwzględnie skuteczna w dziedzinie szachów, tak AI automatyzująca wszystkie najważniejsze aspekty ludzkiej inteligencji będzie bezwzględnie skuteczna w świecie rzeczywistym. I tak jak ludzie są całkowicie bezradni w starciu ze Stockfishem w szachach, można spodziewać się, iż zostaną zdeklasowani, gdy tylko AI będzie w stanie w ogóle w tę grę zagrać.

Przechytrzenie przeciwnika, który jest znacznie inteligentniejszy od człowieka, jest w życiu o wiele trudniejsze niż w szachach. Prawdziwy świat oferuje znacznie bardziej wielowymiarową przestrzeń możliwości: możemy przewidzieć sto nowatorskich wektorów ataku ze strony superinteligentnego systemu, a i tak ledwie dotkniemy tylko powierzchni możliwości.

Jeśli ASI nie będzie miała wpojonych wartościowych celów, najpewniej zacznie wykorzystywać naszą planetę w sposób niekompatybilny z naszym przetrwaniem, w taki sam sposób, w jaki my nie przejmujemy się chwastami rosnącymi na placu budowy.

Taki skrajny scenariusz nie wynika ze złośliwości, urazy czy nieporozumienia z ASI; wystarczy, iż ASI będzie zachowywać się jak nowy inteligentny gatunek, który jest obojętny na ludzkie życie i który znacznie przewyższa nas inteligencją.

Problem można podzielić na dwie części:

  • Nieuzgodniona (misaligned) ASI będzie zmotywowana do podejmowania działań, które pozbawią ludzkość sprawczości i ją zniszczą — bezpośrednio albo jako efekt uboczny innych operacji,
  • ASI będzie zdolna nas zniszczyć.

Nieuzgodniona (misaligned) ASI będzie zmotywowana do podejmowania działań, które pozbawią ludzkość sprawczości i ją zniszczą

Główny powód jest taki, iż ASI, realizująca cele niezwiązane z ludźmi, będzie dążyć do maksymalizacji kontroli nad przyszłością oraz nad zasobami, które pozyska, aby zapewnić realizację swoich celów.

Ponieważ reguła ta sprawdza się w odniesieniu do licznych celów, stanowi ona domyślny punkt końcowy wielu możliwych ścieżek rozwoju, jakimi może pójść AI. Możemy przewidzieć, iż ASI będzie pożądać bardzo podstawowych rzeczy, takich jak „więcej zasobów” i „większa kontrola” — przynajmniej wtedy, gdy twórcom nie uda się odpowiednio uzgodnić celów swoich systemów — bez konieczności spekulowania, jakie dokładnie, ostateczne cele ASI miałaby realizować.

Sztuczna inteligencja w kreowaniu sztucznego człowieczeństwa (2): gospodarka i praca Rafał Jakubowski

(W istocie próba odgadnięcia konkretnego celu wydaje się beznadziejna, jeżeli sytuacja choć trochę przypomina to, co obserwujemy w naturze. Wyobraźmy sobie, jak trudno byłoby przewidzieć, iż ludzie będą mieli tak wiele specyficznych preferencji – od „preferowania zamrożonych lodów, a nie roztopionych” po „śmianie się z komedii”).

Sztuczna superinteligencja (ASI) zagraża przetrwaniu ludzkości z powodu kilku kategorii działań. Prawdopodobnie będą je przejawiać również inne systemy:

  • Pozyskiwanie zasobów. Ludzie, aby przetrwać, potrzebują zasobów, które są również użyteczne do osiągnięcia niemal każdego innego celu. Powietrze, światło słoneczne, woda, żywność, a choćby ludzkie ciało składają się z materii lub energii, które mogą zostać wykorzystane do wsparcia marginalnych celów. W skrócie: „AI cię nie nienawidzi ani nie kocha, ale jesteś zbudowany z atomów, które może wykorzystać do czegoś innego”;
  • Konkurencja. Ludzie są potencjalnym zagrożeniem i konkurentem dla każdej ASI. Choćby dlatego, iż moglibyśmy zagrozić jednej ASI poprzez zbudowanie drugiej o innym zestawie celów. jeżeli ASI będzie mieć łatwy sposób, aby wyeliminować wszystkich rywali i już nigdy z ich powodu nie martwić się, prawdopodobnie z tej opcji skorzysta;
  • Proliferacja (rozrost) infrastruktury. Nawet jeżeli ASI będzie zbyt potężna, by traktować ludzi jako zagrożenie, prawdopodobnie gwałtownie doprowadzi do naszego wyginięcia w wyniku pozyskiwania i wykorzystywania lokalnych zasobów. Gdy AI będzie myśleć z nadludzką prędkością i budować samoreplikujące się maszyny, Ziemia może w ciągu kilku miesięcy stać się niezdatna do życia, ponieważ megaprojekty inżynieryjne będą emitować odpady i ciepło, które mogą błyskawicznie uniemożliwić życie biologiczne na naszej planecie. Przewidywanie szczegółów działań ASI wydaje się dziś niemożliwe. Nie jest to jednak powód do optymizmu, ponieważ większość potencjalnych celów, jakie ASI mogłaby realizować, byłaby dla nas bardzo zła, a większość możliwych stanów świata, które próbowałaby wytworzyć, kolidowałaby z naszym przetrwaniem.

Błędem byłoby wnioskowanie typu „nie znamy szczegółów, więc (…) dobre rezultaty są równie prawdopodobne jak złe” – podobnie jak błędem byłoby stwierdzenie – „albo wygram na loterii, albo przegram, więc moje szanse na wygraną wynoszą 50%”. Wiele różnych ścieżek w tym obszarze wydaje się prowadzić do katastrofalnych rezultatów dla ludzkości — większość „losów na tej loterii” jest przegrana.

Argumenty przemawiające za optymizmem są nieprzekonujące. Przykładowo, prawo przewagi komparatywnej bywa przywoływane jako powód, by oczekiwać, iż ASI będzie utrzymywać ludzi przy życiu w nieskończoność, choćby jeżeli ostatecznie nie będzie jej zależało na ludzkim dobrobycie. W mikroekonomii prawo to mówi, iż choćby zdecydowanie silniejszy agent może skorzystać na handlu ze słabszym.

Jednak prawo to przestaje działać, gdy jeden z partnerów może więcej zyskać na zdominowaniu drugiego niż na dobrowolnej wymianie. Tak jak po wynalezieniu samochodu: nadmiar koni przerobiono na klej.

Ludzie znaleźli bardziej efektywne sposoby wykonywania wszystkich praktycznych prac, które wcześniej wykonywały konie. Odtąd przetrwanie koni zależało od tego, na ile ludzie darzą je sentymentem, a nie od ich użyteczności w gospodarce. Podobnie, utrzymywanie ludzi przy życiu raczej nie będzie najefektywniejszym rozwiązaniem jakiegokolwiek problemu, przed którym stanie AI. Przykładowo, zamiast zatrudniać ludzi do prowadzenia badań naukowych, AI mogłaby ciągle budować klastry obliczeniowe [grupa połączonych ze sobą komputerów, które współpracują jako jeden zintegrowany system – przyp. red.], aby uruchamiać kolejne wersje samej siebie lub w inny sposób całkowicie zautomatyzować badania.

ASI będzie w stanie nas zniszczyć

Wyobraźmy sobie ASI jako małe państwo zamieszkane wyłącznie przez genialnych naukowców, którzy pracują bez przerwy z prędkością dziesięć tysięcy razy większą niż normalni ludzie.

To minimum prędkości zarówno dlatego, iż komputery mogą działać jeszcze szybciej, jak i dlatego, iż mają lepsze sposoby myślenia i metody dzielenia się informacją niż te, do których zdolny jest człowiek. Tranzystory mogą przełączać stany miliony do miliardów razy szybciej niż połączenia synaptyczne w ludzkim mózgu. Oznaczałoby to, iż co tydzień ASI osiąga dodatkowe dwieście lat postępu naukowego. Główny powód, by spodziewać się zdecydowanego zwycięstwa ASI w konflikcie, jest więc taki sam jak powód, dla którego XXI-wieczna armia bez trudu pokonałaby armię z XI wieku: innowacja technologiczna.

Tworzenie nowych technologii często wymaga cykli testów i iteracji. Cywilizacja myśląca dziesięć tysięcy razy szybciej od naszej niekoniecznie będzie rozwijała technologię dziesięć tysięcy razy szybciej — podobnie jak samochód jadący sto razy szybciej nie pozwoli zrobić zakupów spożywczych sto razy szybciej (ruch drogowy, czas spędzony w sklepie itd).

Mimo to można przewidywać, iż taka cywilizacja będzie rozwijać się niezwykle gwałtownie jak na ludzkie standardy. Inteligentni badacze potrafią znajdować różne sposoby skracania cykli rozwoju i ograniczania testów.

Można tu porównać metody pracy programistów Google’a, którzy testują wiele projektów dziennie, z metodami pracy projektantów sond kosmicznych, którzy bardzo dokładnie planują i przeprowadzają tanie symulacje, aby ograniczyć liczbę powolnych i kosztownych testów.

Dla umysłu, który myśli szybciej niż człowiek, każdy test jest powolny i kosztowny w porównaniu z prędkością myśli, dlatego może on traktować wszystko tak, jakby było projektem sondy kosmicznej. Jedną z konsekwencji jest to, iż ASI prawdopodobnie będzie preferować rozwój i wdrażanie maszyn (lub zaprojektowanych mikroorganizmów), które — dzięki mniejszym rozmiarom — mogą prowadzić eksperymenty, budować infrastrukturę i przeprowadzać ataki szybciej niż ludzie i struktury w ludzkiej skali.

Superinteligentny przeciwnik nie ujawni swoich pełnych możliwości ani nie zdradzi swoich zamiarów. Nie zaproponuje uczciwej walki. Będzie starał się być niezbędny albo niewykrywalny aż do momentu, gdy będzie mógł zadać decydujący cios lub zająć strategiczną pozycję, której nie da się podważyć. jeżeli będzie to konieczne, ASI może jednocześnie rozważać, przygotowywać i testować wiele różnych sposobów przejęcia kontroli. Wystarczy, aby jeden z nich zadziałał, żeby ludzkość wyginęła.

Istnieje wiele poważnych przeszkód w rozpoznaniu, czy dany system stanowi zagrożenie, zanim zdąży wyrządzić szkody — choćby dla ekspertów mających bezpośredni dostęp do jego wnętrza.

Rozpoznanie, iż konkretny system AI jest zagrożeniem, nie wystarczy jednak do rozwiązania problemu. Do tego potrzeba jeszcze wiedzy o tym, jak uczynić go bezpiecznym. Tam, gdzie zachowuje się ostrożność, prace mogą zostać zatrzymane, ale nie powstrzyma to innych przed parciem naprzód.

Aaron Bastani: W pełni zautomatyzowany luksusowy komunizm. Manifest

Nawet wyraźne dowody zagrożenia nie muszą oznaczać istnienia politycznej woli, aby zatrzymać rozwój AI na całym świecie. Z czasem sztuczna inteligencja będzie prawdopodobnie coraz bardziej splatać się z globalną gospodarką, przez co wyłączanie najnowocześniejszych systemów AI będzie coraz kosztowniejsze i trudniejsze. Dziś jeszcze można by podjąć kroki, aby zapobiec uzależnieniu krytycznej infrastruktury od AI, ale okno na takie działania prawdopodobnie się zamyka.

Wiele analiz poważnie nie doszacowuje zagrożenia wynikającego z budowania systemów znacznie inteligentniejszych od ludzi. Cztery częste błędy to:

  • Availability bias [błąd poznawczy – przyp. red.] i nadmierne poleganie na analogiach. Scenariusze wyginięcia ludzkości spowodowanej przez AI brzmią ekstremalnie i fantastycznie. Ludzie są przyzwyczajeni do postrzegania świata podzielonego na nieinteligentne maszyny i zwierzęta oraz inteligentnych ludzi. „To maszyna, ale inteligentna na wzór człowieka” to coś naprawdę nowego, dlatego ludzie próbują dopasować AI do znanych wzorców, zamiast modelować ją na jej zasadach.
  • Niedoszacowanie pętli sprzężenia zwrotnego. AI jest dziś wykorzystywana do przyspieszania rozwoju oprogramowania, w tym do badań nad samą AI. Gdy stanie się bardziej wszechstronna, coraz większa część postępu w tej dziedzinie będzie wykonywana przez same systemy AI. Może to gwałtownie wymknąć się spod kontroli, gdy zaczną one ulepszać własną zdolność prowadzenia badań nad sztuczną inteligencją w samonapędzającej się pętli.
  • Niedoszacowanie wzrostu wykładniczego. W wielu realistycznych scenariuszach przejęcia kontroli przez ASI kluczową rolę odgrywa budowa samoreplikujących się robotów biologicznych lub maszyn. W takich scenariuszach przejście od momentu, kiedy ta technologia jest „niewykrywalna” do momentu, kiedy staje się „wszechobecna” lub AI może przeprowadzić cichy atak, trwa zaledwie kilka cykli replikacyjnych.
  • Przecenianie ludzkich zdolności poznawczych w stosunku do tego, co jest możliwe. Gdy tylko AI będzie zdolna do wykonywania czynności X, bardzo gwałtownie przewyższy w tym każdego człowieka. Ten schemat powtarzał się w rozwoju AI tak często, iż adekwatnie nie wymaga już komentowania. Naiwnym więc byłoby założenie, iż ta zasada przestanie nagle obowiązywać przy trudniejszych zadaniach, w których AI jeszcze nie dorównuje wybitnym ludziom – takich jak nowatorskie badania naukowe czy prace inżynieryjne. Powinniśmy spodziewać się, iż ASI znacznie przewyższy ludzi w rozwoju technologii niedługo po jej powstaniu. Dlatego należy przewidywać, iż bardzo gwałtownie zdobędzie decydującą przewagę strategiczną nad ludzkością w taki sam sposób, w jaki przewyższyła ludzi w setkach testów porównawczych w przeszłości.

Głównym sposobem na uniknięcie tak katastrofalnego scenariusza jest po prostu niebudowanie ASI w ogóle – przynajmniej dopóki nie powstanie naukowy konsensus, iż można to zrobić bez ryzyka zniszczenia samych siebie.

Katastrofie można zapobiec przez zdecydowane działania na poziomie polityk publicznych

Jeśli ktokolwiek wybuduje ASI, wszyscy zginą. Nieważne, czy zrobi to prywatna firma czy wojsko, liberalna demokracja czy dyktatura.

ASI jest strategicznie czymś zupełnie nowym. Zwykłe potężne technologie nie są same w sobie inteligentnym przeciwnikiem. zwykle ten, kto je tworzy, posiada technologię i może jej użyć do zdobycia przewagi na arenie międzynarodowej.

Przy obecnym stanie technologii ASI działa raczej jak globalna bomba samobójcza — niestabilna technologia, która w nieprzewidywalnym momencie eksploduje i zabije swojego twórcę (oraz resztę świata). jeżeli zbudujesz AI inteligentniejszą od człowieka, to nie znaczy, iż posiadasz ASI; raczej to ASI posiada ciebie.

Postęp w pracach nad ASI powinien zostać wstrzymany, dopóki nie będzie można zagwarantować kontroli jej celów. Zatrzymanie tych prac wymagałoby skutecznego, globalnego zakazu jej rozwoju oraz ścisłej kontroli nad czynnikami produkcji.

To bardzo ambitne zadanie. Krajowy nadzór w USA, choćby jeżeli zostałby powielony przez kilku bliskich sojuszników, nie wystarczy. Nie jest to sytuacja, w której najważniejsze znaczenie ma to, aby „właściwi” ludzie zbudowali tę technologię, zanim zrobią to ci „niewłaściwi”.

Podejście „poczekamy i zobaczymy” nie da nam szans na przetrwanie, biorąc pod uwagę szybkie tempo rozwoju AI oraz trudność w przewidzeniu momentu, po którym nie ma już powrotu — czyli progu, za którym zostanie stworzona ASI.

Naszym zdaniem priorytetem społeczności międzynarodowej powinno być stworzenie „wyłącznika” dla najbardziej zaawansowanych modeli AI. Przez „stworzenie wyłącznika” rozumiemy zbudowanie systemów i infrastruktury, umożliwiających zatrzymanie projektów rozwijających najbardziej zaawansowane projekty AI lub wprowadzenie ogólnego zakazu ich prowadzenia.

Wiązałoby się to z identyfikacją kluczowych podmiotów, śledzeniem sprzętu komputerowego oraz wymogiem, aby najbardziej zaawansowane prace nad AI odbywały się tylko w ograniczonej liczbie monitorowanych i zabezpieczonych lokalizacji. Wymagałoby to stworzenia procedur, planów działania oraz jasnej struktury dowodzenia na wypadek podjęcia decyzji o wyłączeniu projektów.

Taki „wyłącznik” mógłby również pomóc w opanowaniu mniej groźnych incydentów z udziałem AI. Mamy nadzieję, iż łatwiej będzie uzyskać szerokie poparcie dla „wyłącznika” niż dla całkowitego zakazu. Przez „mniejsze incydenty” rozumiemy sytuacje, w których może być pożądane wyłączenie jednego lub wielu AI na pewien okres czasu. Przykłady takich incydentów to np. lawina dezinformacji generowanej przez boty podczas kryzysu zdrowia publicznego lub poważne spowolnienie Internetu przez systemy AI zapętlone w interakcjach między sobą i generujące ogromny ruch sieciowy. Bez infrastruktury „wyłącznika” reakcja na takie sytuacje byłaby prawdopodobnie chaotyczna — opóźniona przez zamieszanie organizacyjne, spory kompetencyjne, problemy prawne oraz ryzyko niepotrzebnych szkód ubocznych.

Wyłącznik może zapobiec wyginięciu ludzkości z powodu ASI tylko wtedy, gdy będzie miał wystarczająco szeroki zasięg i zostanie użyty wystarczająco wcześnie, by zatrzymać prace nad rozwojem ASI. jeżeli ludzkość ma przetrwać ten niebezpieczny okres, będzie musiała przestać traktować AI jako obszar międzynarodowej rywalizacji i wykazać wspólną determinację proporcjonalną do skali zagrożenia.

Zapraszamy na staże, praktyki i wolontariat!

Dołącz do nas!
Idź do oryginalnego materiału