Pokazali to złudzenie ludziom, małpom i sztucznej inteligencji. Tylko komputer nie dał się nabrać

konto.spidersweb.pl 1 godzina temu

Naukowcy porównali ludzi, mózg makaka i modele AI. Sztuczny wzrok zdecydowanie nie korzysta z informacji tak jak biologiczny.

Najpierw przez chwilę patrzysz na ruch w jednym kierunku, zaraz potem nieruchomy obiekt wydaje się lekko przesunięty w przeciwną stronę, choć na ekranie nic się nie zmieniło. To stare i bardzo proste złudzenie wzrokowe. Naukowcy z York University pokazali je ludziom, porównali z aktywnością mózgu makaków, a później sprawdzili współczesne modele komputerowego widzenia. Człowiek i mózg małpy popełniali ten sam przewidywalny błąd, AI nie. Właśnie dlatego badacze uznali, iż czegoś ważnego w jej sposobie widzenia przez cały czas brakuje.

Obiekt stoi w miejscu, ale nasz mózg widzi go zupełnie inaczej

Zjawisko wykorzystane w eksperymencie nazywa się powidokiem ruchowym lub efektem wodospadu. jeżeli przez pewien czas obserwujemy ruch w jednym kierunku, a później spojrzymy na nieruchomy obiekt, to jego położenie może wydawać się nieznacznie przesunięte. Piksele są jednak dokładnie tam, gdzie wcześniej. Zmienia się po prostu jedynie nasza percepcja.

Ta sztuczka skutecznie pozwala oddzielić fizyczne położenie obiektu od tego, gdzie widzi go obserwator. W zwykłym eksperymencie te dwie rzeczy nakładają się na siebie i trudno powiedzieć, czy neuron albo model komputerowy koduje to, co faktycznie znajduje się na obrazie, czy to, co ostatecznie postrzega organizm.

W nowym badaniu naukowcy związani z York University połączyli eksperymenty z ludźmi z zapisami aktywności kory wzrokowej makaków. Interesował ich szczególnie obszar dolnej kory skroniowej, w uproszczeniu IT, będący częścią szlaku wzrokowego mocno związanego z rozpoznawaniem obiektów.

Okazało się, iż po adaptacji do ruchu reprezentacja położenia obiektu w mózgu makaka przesuwała się w tym samym kierunku, w którym ludzie zgłaszali złudzenie. Mózg nie kodował więc po prostu współrzędnych z siatkówki.

Później naukowcy powtórzyli podobny test z różnymi sztucznymi sieciami neuronowymi. Sprawdzili klasyczne sieci przetwarzające pojedyncze obrazy, modele rekurencyjne oraz nowocześniejsze sieci przygotowane do analizy wideo. Wszystkie potrafiły całkiem dobrze określać położenie obiektów.

Po wcześniejszym pokazaniu ruchu nic szczególnego się jednak nie działo. Reprezentacja pozycji pozostawała związana z faktycznym położeniem obiektu w obrazie. Nie pojawiała się systematyczna zmiana odpowiadająca temu, co widzieli ludzie i co rejestrowano w mózgu makaków.

Paradoksalnie AI była więc bardziej poprawna. Obiekt stał w określonym miejscu i model dokładnie to zakodował. Tyle iż celem eksperymentu nie było znalezienie najlepszego systemu do mierzenia współrzędnych. Naukowcy chcieli bowiem sprawdzić, czy dzisiejsze modele komputerowego widzenia wykorzystują niedawną historię bodźców w podobny sposób jak biologiczny układ wzrokowy. Okazało się jednak, iż nie wykorzystywały.

Nasz wzrok nie zaczyna od zera

Człowiek nie analizuje każdego nowego obrazu tak, jakby niczego wcześniej nie widział. Aktualna percepcja zależy również od tego, co działo się chwilę wcześniej. Po dłuższym oglądaniu ruchu część neuronów odpowiedzialnych za jego przetwarzanie zmienia swoją aktywność. Kolejny bodziec jest więc interpretowany przez układ, który znajduje się już w innym stanie niż przed chwilą.

Można więc powiedzieć, iż złudzenie optyczne jest tutaj skutkiem ubocznym tego mechanizmu, ale jednocześnie pozwala go wykryć. To nie pierwszy raz, gdy złudzenia okazują się dobrym sposobem na podejrzenie tego, jak mózg konstruuje obraz świata. Nasz wzrok regularnie dopowiada, porządkuje i interpretuje informacje zamiast traktować obraz jak zbiór niezależnych pikseli.

Co ciekawe, wcześniejsze eksperymenty z York University pokazywały również sytuację odwrotną. Niektóre sieci neuronowe mogą ulegać złudzeniom jasności podobnym do tych obserwowanych u ludzi. Wszystko zależy więc od zadania i sposobu treningu. Dzisiejsza AI nie jest po prostu odporna na iluzje. W niektórych aspektach zbiega się z ludzką percepcją, a w innych bardzo wyraźnie się od niej oddala.

Mózg dał podpowiedź, jak poprawić model

Badacze zrobili jeszcze jeden eksperyment. Skoro sztuczne sieci nie wykazywały odpowiedniego przesunięcia, spróbowali matematycznie zmodyfikować ich wewnętrzne reprezentacje zgodnie ze zmianami zaobserwowanymi w mózgu makaków. Po zastosowaniu transformacji wyprowadzonych z aktywności IT także w modelach zaczęły pojawiać się podobne przesunięcia.

Naukowcy właśnie stworzyli więc komputerowy mózg? Z całą pewnością nie można tak stwierdzić, ale eksperyment świetnie pokazuje, iż różnica nie wynika wyłącznie z tego, iż sztuczne sieci są zbyt małe albo za mało dokładne. Brakuje im konkretnego rodzaju dynamicznego przetwarzania, które zmienia reprezentację obrazu pod wpływem niedawnej historii.

To istotne również dlatego, iż współczesne systemy widzenia maszynowego są coraz częściej używane w urządzeniach działających w zmiennym świecie: robotach, pojazdach czy systemach analizujących wideo. Model może osiągać świetny wynik na statycznym benchmarku, a mimo to przetwarzać sekwencję wydarzeń zupełnie inaczej niż człowiek.

Już wcześniej zdarzało się, iż modele AI potykały się o pozornie banalne zadania wzrokowe. Tam problem polegał jednak na błędnej interpretacji samego obrazu. Tutaj sytuacja jest ciekawsza, bo AI poprawnie widzi, gdzie znajduje się obiekt, ale nie przechodzi tej samej adaptacji, która zmienia ludzką percepcję.

*Źródło grafiki wprowadzającej: Kirandeep Singh Walia, Pexels / Canva Pro

Idź do oryginalnego materiału