System AI jako otwarty układ termodynamiczny

edwardweinert.com 7 miesięcy temu

Jak tworzyć i utrzymywać systemy IT w dobie AI Przez dziesięciolecia systemy informatyczne postrzegano jako narzędzia ściśle deterministyczne. Pojawienie się zaawansowanych modeli LLM zburzyło tę przewidywalność, wprowadzając zjawisko halucynacji, które przenosi niepewność wyników na całe systemy IT. Halucynacja nie jest formą wiedzy, ale statystyczną rekonstrukcją struktury językowej dążącą do minimalizacji lokalnej entropii. Co więcej, rekonstrukcja ta nie odbywa się w próżni, ale uwzględnia charakter ludzkiej natury z całym dobrodziejstwem jej inwencji, ale i ciężarem błędów poznawczych. W tym ujęciu halucynacja staje się swoistą mimikrą: model, dążąc do spójności, naśladuje ludzki sposób argumentacji tak przekonująco, iż granica między informacją a jej statystycznym pozorem ulega zatarciu. W niniejszym artykule proponuję podejście, w którym system IT traktowany jest jako otwarty układ termodynamiczny podlegający prawom fizyki informacji. Analizuję ewolucję pojęć od silnika parowego Carnota po Zasadę Landauera, by dowieść, iż przetwarzanie informacji zawsze wiąże się z kosztem energetycznym i wzrostem nieuporządkowania. Kluczowym elementem propozycji jest wdrożenie „Agentów-Demonów Maxwella” w cykl życia systemu od definiowania wymagań, programowanie, aż po po automatyczny monitoring systemu i jego rozwój, co pozwala na redukcję entropii na każdym etapie. Dzięki temu możliwe jest precyzyjne zaplanowanie kompromisu między trafnością informacji a kosztami stworzenia, utrzymania i rozwoju systemu. Halucynacja jako rekonstrukcja brakującej informacji Nieodłączną częścią dużych modeli językowych (LLM) są halucynacje. Podczas generowania odpowiedzi AI potrafi czasami stworzyć pozornie sensowne, ale nieprawdziwe lub niezweryfikowane informacje, które przedstawiane są z dużą pewnością co do ich prawdziwości. Model AI bowiem nie wie co jest prawdą, a co jest fałszem. Nie jest bazą wiedzy, nie zna faktów. Przykładowo w przypadku zdania „stolicą Polski jest …” słowo „Warszawa” pojawi się nie dlatego, iż model posiada tą wiedzę, ale jest to najczęściej występujące słowo w tym kontekście w danych treningowych. Model rekonstruuje tylko konstrukcje językowe na podstawie wzorców statystycznych, których wcześniej został nauczony. jeżeli w kontekście pojawia się brak danych lub kontekst jest niejednoznaczny, to model wypełnia lukę informacją, która według niego zapewnia najbardziej stabilną strukturę językową, minimalizując w ten sposób entropię i nie ma to nic wspólnego z pojęciem wiedzy. Nieodłączną częścią dużych modeli językowych (LLM) są halucynacje. Podczas generowania odpowiedzi AI potrafi czasami stworzyć pozornie sensowne, ale nieprawdziwe lub niezweryfikowane informacje, które przedstawiane są z dużą pewnością co do ich prawdziwości. Model AI bowiem nie wie co jest prawdą, a co jest fałszem. Nie jest bazą wiedzy, nie zna faktów. Przykładowo w przypadku zdania „stolicą Polski jest …” słowo „Warszawa” pojawi się nie dlatego, iż model posiada tą wiedzę, ale jest to najczęściej występujące słowo w tym kontekście w danych treningowych. Rekonstruuje on tylko konstrukcje językowe na podstawie wzorców statystycznych, których wcześniej został nauczony. jeżeli w kontekście pojawia się brak danych lub kontekst jest niejednoznaczny, to model wypełnia lukę informacją, która według niego zapewnia najbardziej stabilną strukturę językową, minimalizując w ten sposób entropię i nie ma to nic wspólnego z pojęciem wiedzy. Mimikra. Gdy statystyka udaje człowieka Proces rekonstrukcji brakującej informacji nie odbywa się jednak w próżni matematycznej. Model dąży do minimalizacji entropii poprzez naśladownictwo danych, na których został wytrenowany, a dane są oczywiście wytworzone przez ludzkość. W efekcie halucynacja staje się swoistą mimikrą, która uwzględnia charakter ludzkiej natury z wszystkimi jej zaletami i wadami. Model nie tylko wypełnia luki, ale robi on to w sposób „ludzki”. Przejmuje naszą retorykę, błędy poznawcze, a choćby skłonność do konfabulacji w celu zachowania spójności narracji. Mimikra sprawia, iż halucynacja nie jest chaotycznym ciągiem znaków, ale przekonującą, profesjonalnie brzmiącą odpowiedzią. Z perspektywy termodynamicznej model wybiera ścieżkę najmniejszego oporu, łatwiej i taniej jest wygenerować statystycznie prawdopodobne naśladownictwo, niż przyznać się do braku danych, co z punktu widzenia struktury języka byłoby stanem o wyższej entropii (przerwaniem ciągłości wzorca). Należy zaznaczyć, iż owa mimikra wykracza poza czystą stylistykę czy gramatykę. Modele AI, ucząc się na gigantycznych zbiorach ludzkich wypowiedzi, nieświadomie przejmują i odtwarzają kondycję psychiczną człowieka. Halucynacje stają się nośnikiem ludzkich uprzedzeń, lęków i błędów poznawczych. Model, dążąc do minimalizacji lokalnej entropii, wybiera matematycznie optymalne rozwiązanie, ale jest ono „statystycznie ludzkie”. W ten sposób do systemów IT przenika nie tylko losowość (rzut kością), ale wręcz antropomorficzna niestabilność. System może podjąć błędną decyzję nie dlatego, iż zabrakło mu danych, ale dlatego, iż w procesie mimikry powielił ludzki schemat irracjonalnego myślenia. Gra w kości, czyli wpływ halucynacji na systemy IT W klasycznych systemach informatycznych dane są mocno usystematyzowane, a zaprojektowane algorytmy dokonują wyborów na podstawie jasnych i dobrze zdefiniowanych warunków. System taki jest mocno deterministyczny a entropia niewielka, wolno rosnąca i dająca się łatwo redukować, choćby biorąc pod uwagę błędy w oprogramowaniu i awarie. Wiedząc jakie dane są na wejściu wiemy co otrzymamy na wyjściu. Wyobraźmy teraz sobie, iż w tym deterministycznym świecie przy obliczeniach i przy podejmowaniu decyzji rzucamy dodatkowo kostką do gry. jeżeli wypadnie 6 oczek, to wynik obliczeń zmieniamy o losową wartość. W ten sposób losowo wpływamy na działanie systemu, który dla tych samych danych wejściowych potrafi zwrócić różne wyniki lub wykonać inne działania. W systemach gdzie modele AI służą nie tylko do przetwarzania informacji tekstowych, ale przede wszystkim do podejmowania decyzji na podstawie danych i kontekstu, halucynacje są niepożądane, gdyż wprowadzają element losowości na etapie podejmowania decyzji. Zjawisko to staje się jednak jeszcze bardziej krytyczne, gdy „gra w kości” przenosi się z fazy działania systemu do fazy jego tworzenia. W nowoczesnych cyklach wytwórczych, gdzie agenci AI odpowiadają za 95% kodu, projektowanie logiki czy tworzenie testów, halucynacja może stać się ukrytą wadą konstrukcyjną. jeżeli agent AI, ulegając mimikrze, wygeneruje wymaganie lub fragment kodu, które wyglądają na potrzebne, profesjonalne i optymalne, ale w rzeczywistości opierają się na nieistniejących lub błędnych założeniach logicznych, entropia zostaje wbudowana bezpośrednio w fundamenty systemu. W takim scenariuszu niepewność przestaje dotyczyć tylko odpowiedzi modelu, a zaczyna dotyczyć samej integralności systemu i realizowanych funkcji. Bez rygorystycznego nadzoru wyspecjalizowanych „Demonów Maxwella” na etapie produkcji, system staje się kruchą strukturą, w której błędy wynikające z halucynacji mogą kaskadowo narastać, czyniąc proces debugowania i utrzymania ekstremalnie kosztownym. System IT jako otwarty układ termodynamiczny Termodynamika jest działem fizyki, który bada makroskopowe procesy związane z energią i jej przemianami w układach fizycznych. Opisuje je dzięki temperatury, ciśnienia, objętości, przemianą i transportem energii, czy wreszcie entropią. Nie wnika w szczegóły budowy tych układów, nie analizuje drgań atomów i zderzeń cząsteczek. Powstała przed rozwojem fizyki atomowej i molekularnej, a jej zasady pozwalają opisać procesy energetyczne na dużą skalę, co jest wystarczające do rozwoju techniki i inżynierii, np. budowy maszyn parowych, bez potrzeby rozumienia, co dzieje się na poziomie atomów. Podobnie jest z systemem informatycznym. Nie musimy wiedzieć dokładnie jak jest skonstruowane oprogramowanie. Monitoruje się go na poziomie makroskopowym, zbierając dane o ogólnej wydajności i zachowaniu, bez konieczności śledzenia każdego pojedynczego cyklu procesora czy zmian w poszczególnych bajtach danych. W termodynamice w zależności od interakcji z otoczeniem mamy do czynienia z układem izolowanym, zamkniętym lub otwartym: System informatyczny, w szczególności wykorzystujący modele AI do przetwarzania informacji, jest układem otwartym. Dostarczamy dane (informacje) z zewnątrz i energię do ich przetwarzania, a rezultat zostaje przesłany na zewnątrz. Entropia jest związana z danymi oraz modelami. Co więcej, doświadczamy dryfu danych i modeli, tworzone są zupełnie nowe dane, a same modele się starzeją, więc rezultat ich pracy staje się coraz mniej pewny. Można zadać pytanie, czy taka analogia jest uprawniona? Jak wirtualna informacja ma się do fizycznych bytów i fizycznych praw? Czy informacja jest związana z energią i entropią? Czy może jednak mamy do czynienia tylko z metafizyką? Fizyka informacji Aby rozwiać wątpliwości, czy do systemu informatycznego, w szczególności wykorzystującego modele AI do procesowania danych, można stosować prawa termodynamiki należy przynajmniej pobieżnie prześledzić jak ewoluowały idee i poglądy fizyków, matematyków i inżynierów na powiązanie informacji z entropią i energią. w tej chwili fizyka informacji, a zwłaszcza kwantowa teoria informacji jest jedną z najszybciej rozwijających się dziedzin fizyki. Historia powstania fizyki informacji jest tak fascynująca, wielowątkowa i skomplikowana, iż można jej poświęcić całą książkę. Postaram się jednak w dużym skrócie przedstawić jak powstała ta koncepcja, w której zanurzone są modele uczenia maszynowego, AI i systemy informatyczne. Będę także bardzo oszczędnie operował wzorami, odsyłając do źródeł, ale bez kilku kluczowych równań nie może się obejść, choć będzie to raczej na zasadzie analizy podobieństwa między obrazami. Od silnika parowego do termodynamiki i entropii Na początku XIX wieku francuski fizyk i inżynier Nicolas Sidi Carnot badał możliwość ulepszenia sprawności silników parowych. W 1824 roku opublikował swoje badania tworząc podwaliny pod termodynamikę. Postulował koncepcję, iż podczas zamiany ciepła na pracę zawsze jest tracona część energii, choćby w silnikach idealnych, pomijając straty wynikające z tarcia i jakichkolwiek innych niedoskonałości rzeczywistych maszyn. Ten postulat niedługo został nazwany entropią przez niemieckiego fizyka i matematyk Rudolfa Clausiusa, który w latach 1854-1865 wprowadził koncepcję nieodwracalnej utraty ciepła w układzie termodynamicznym. Sformułował również drugą zasadę termodynamiki: entropia w zamkniętym układzie nie maleje. Demon Maxwella Już dwa lata później w roku 1867 szkocki fizyk i matematyk James Clerk Maxwell przedstawił swój słynny eksperyment myślowy szukając luk w drugiej zasadzie termodynamiki. W eksperymencie tym układ zawiera cząsteczki o różnych prędkościach i podzielony jest na dwie komory z małym zamykanym otworem między komorami. Hipotetyczna istota zwana demonem, sortuje cząsteczki gazu przepuszczając je przez otwór, tak by oddzielić szybkie (gorące) od wolnych (zimnych). W ten sposób Demon Maxwella tworzy różnicę temperatur bez wykonywania pracy, co pozornie łamie drugą zasadę termodynamiki. Ścisłe rozwiązanie tego paradoksu zajęło naukowcom ponad 100 lat. To pierwszy punkt zwrotny w historii fizyki informacji.(Obraz autorstwa User:Htkym – Praca własna, CC BY 2.5, https://commons.wikimedia.org/w/index.php?curid=1625737) Od termodynamiki do mechaniki statystycznej Łamiąc sobie głowy nad Demonem Maxwella fizycy, matematycy i inżynierowie jednocześnie rozwijali teorię termodynamiki. Amerykański inżynier i naukowiec J. Willard Gibbs zaproponował w 1876 roku ścisłe obliczenie ilości dostępnej (swobodnej) energii w układzie jako różnica energii całkowitej układu i straty energii spowodowanej entropią. W 1877 austriacki matematyk i fizyk Ludwig Boltzmann opisał entropię w postaci statystyki wszystkich możliwych mikrostanów układu, uznając ją za miarę statystycznego nieuporządkowania. Prawdopodobnie to w tym momencie historii ma swoje źródło przekonanie, iż entropia to chaos. Można ją zapisać jako: $$ S = -k_B \ln\Omega, $$ gdzie $S$ to entropia, $k_B$ stała Boltzmanna, a $\Omega$ oznacza liczbę mikrostanów zgodnych z danym „makrostanem” układu. W 1902 roku Gibbs rozwinął teorię Boltzmanna i wyprowadził prawa termodynamiki ze statystycznych adekwatności układów składających się z wielu cząstek, dając podwaliny mechanice statystycznej. W ten sposób entropia w termodynamice otrzymała matematyczną formę taką samą jak Shannon wprowadził później w swojej teorii informacji: $$ S = -k_B\sum_{i} p_i \ln(p_i), $$ gdzie $p_i$ to prawdopodobieństwo, iż układ jest w $i$-tym mikrostanie. Nierozwiązana kwestia łamania drugiej zasady termodynamiki przez Demona Maxwella nie dawała spokoju naukowcom, ale jednocześnie, wraz z rozwojem idei fizycznych i coraz bardziej zaawansowanych rozwiązań matematycznych, była inspiracją w poszukiwaniach wyjaśnienia paradoksu. Demon Maxwella za darmo nie pracuje W 1929 roku urodzony na Węgrzech fizyk i biolog Leo Szilard zauważył, iż demon dokonując pomiaru prędkości cząsteczek w pudle wykonuje pracę i w związku z tym musi wydatkować energię na tą czynność zdobywania wiedzy. Ponieważ demon i gaz oddziałują na siebie, należy więc rozpatrywać demona jako część układu. Demon zużywając energię powoduje wzrost entropii u siebie, a sam wydatek energetyczny będzie większy niż obniżenie entropii gazu (postulat Carnot’a). W zaproponowanym przez Szilarda rozwiązaniu pierwszy raz pojawiła się informacja (zdobywanie wiedzy) jako element układu i to jest to kolejny punkt zwrotny w fizyce informacji. Myślę, iż to, iż Szilard był biologiem w jakiś sposób pomogło mu wpaść na ten pomysł. Warto bacznie obserwować biologię kwantową i kwantową teorię informacji. Teoria Informacji i Entropia Shannona W roku 1948 amerykański matematyk i inżynier Claude Shannon opublikował pracę o teorii informacji i entropii jako mierze niepewności informacji (pracował głównie z sygnałami analogowymi). Shannon nie miał pomysłu jak nazwać miarę opisującą braki w informacji. Nazwę „entropia” podsunął mu matematyk i fizyk von Neumann. Zainspirowany tym Shannon jednym z przykładów zastosowania entropii w ujęciu swojej teorii informacji powołał się na mechanikę statystyczną i twierdzenie H Boltzmanna. Patrząc na matematyczną definicję entropi Shannona analogie do entropii termodynamicznej same się nasuwają: $$ H(X) = -\sum_{x\in X} p(x) \log_b p(x), $$ gdzie $p_i$ to prawdopdobieństwo zajścia $i$-tego zdarzenia, $\log_b$ jest logarytmem o podstawie $b$ (dla informacji binarnej $b=2$). Matematyczne i pojęciowe podobieństwo między entropią w układzie termodynamicznym i entropią informacji spowodowało, iż wielu naukowców zaczęło dopatrywać się między entropiami...

Idź do oryginalnego materiału