
Zamiast przepuszczać każdy film przez ciężką sieć neuronową, nowy detektor część obliczeń wykonuje fizycznie dzięki światła.
Deepfake może wyglądać idealnie dla człowieka, a mimo to przegrać z kawałkiem optyki. Naukowcy z Uniwersytetu Kalifornijskiego w Los Angeles zbudowali detektor, który nie wykonuje całej analizy na procesorze czy karcie graficznej. Część obliczeń przejmuje natomiast światło, które przechodzi przez specjalnie przygotowany układ optyczny.
W eksperymencie system sprawdzał 15 filmów jednocześnie i na popularnym zbiorze Celeb-DF osiągnął średnią skuteczność 97,79 proc. Jeszcze ciekawsza jest czułość, bo aż 99,86 proc. fałszywych nagrań zostało prawidłowo wychwyconych. Oznacza to, iż zaledwie około 0,14 proc. deepfake’ów prześlizgnęło się przez pierwsze sito jako prawdziwe.
Film najpierw zamienia się we wzór dla światła
System opracowali Parnian Ghapandar Kashani, Shiqi Chen i Aydogan Ozcan z UCLA. Nie jest to jednak gadżet, który wystarczy skierować na ekran. Pierwszy etap przez cały czas odbywa się cyfrowo. Z każdego filmu wybieranych jest 12 klatek, wykrywana jest na nich twarz, a niewielkie sieci neuronowe analizują obraz zarówno w zwykłej przestrzeni, jak i w dziedzinie częstotliwości. Zebrane cechy są następnie zamieniane w specjalny wzór fazowy. Dopiero wtedy zaczyna się najciekawsza część.
Wzór trafia na przestrzenny modulator światła, który zmienia fazę przechodzącej przez niego wiązki. Światło propaguje się dalej przez układ i dzięki dyfrakcji samo wykonuje część obliczeń potrzebnych do klasyfikacji. Na końcu fotodetektory mierzą intensywność sygnału w dwóch obszarach przypisanych każdemu filmowi. Przewaga jednego oznacza fałszywy, drugiego prawdziwy. Nie trzeba więc cyfrowo liczyć każdego kolejnego kroku sieci. Część matematyki wykonują po prostu prawa fizyki.
Największą zaletą rozwiązania nie jest choćby sama skuteczność, ale przede wszystkim sposób skalowania. W demonstracji naukowcy zakodowali równocześnie 15 osobnych filmów na jednym modulatorze. Wszystkie zostały przeanalizowane podczas pojedynczego przejścia światła przez układ.
Przy 15 strumieniach dokładność wyniosła 97,79 proc., czułość 99,86 proc., a prawidłowe rozpoznawanie materiałów autentycznych 95,72 proc. Gdy zespół upchnął w jednym układzie 18 filmów, dokładność spadła do 96,13 proc. Powodem były m.in. zakłócenia pomiędzy coraz ciaśniej rozmieszczonymi kanałami optycznymi.
Badacze szacują jednak, iż współczesny modulator o rozdzielczości około 10 megapikseli mógłby obsłużyć mniej więcej 120 filmów jednocześnie. W praktycznym systemie największym ograniczeniem nie byłaby wtedy sama optyka, ale cyfrowy etap przygotowujący materiał do analizy.
Nawet Veo 3 nie przeszło niezauważone
Celeb-DF jest dobrze znanym zestawem deepfake’ów opartych głównie na podmianie twarzy. Dla współczesnych generatorów to trochę za łatwy przeciwnik, dlatego zespół przygotował dodatkowy test. Naukowcy stworzyli własny zestaw filmów dzięki Veo 3 Google’a. To ważna różnica, bo model generuje całe nagranie od podstaw, zamiast nakładać cudzą twarz na istniejący materiał. Wiele klasycznych śladów po montażu czy podmianie twarzy po prostu wtedy nie występuje.
Detektor wymagał dostrojenia, ale niewielkiego. Badacze wykorzystali do tego tylko 50 filmów z Veo 3, co odpowiadało mniej niż 1 proc. pełnego treningu pierwotnego modelu. Potem system osiągnął w fizycznym eksperymencie 94,8 proc. dokładności oraz 97,61 proc. czułości. To przez cały czas nie oznacza oczywiście uniwersalnego detektora wszystkich materiałów AI. Pokazuje jednak, iż rozwiązanie nie działa wyłącznie dlatego, iż nauczyło się kilku charakterystycznych błędów starszych generatorów.
Światło ma jeszcze jedną przewagę: prawie nie zużywa energii na liczenie
Typowe detektory uruchamiane na GPU wykonują ogromną liczbę operacji dla wszystkich materiału. Przy pojedynczym filmie nie musi to być problem. Przy milionach nagrań wrzucanych codziennie do serwisów społecznościowych rachunek zaczyna wyglądać zupełnie inaczej.
W optycznym dekoderze po ustawieniu wzoru najważniejsza operacja odbywa się podczas samego rozchodzenia światła. Zespół oszacował zużycie energii tego etapu na około 1,38-4,11 mJ na film przy 15 równoległych kanałach.
Porównywalny pod względem wyników cyfrowy dekoder zużywał około 30,44 mJ. Przy tej samej przepustowości sam optyczny etap mógł więc potrzebować od około 86,5 do 95,5 proc. mniej mocy. Cały system przez cały czas ma jednak cyfrowy początek, więc oszczędność od gniazdka do wyniku jest mniejsza. Autorzy nie ukrywają, iż to rozwiązanie hybrydowe, a nie komputer bez elektroniki.
98 proc. to wynik uzyskany na konkretnym zbiorze Celeb-DF i przy konkretnej konfiguracji laboratoryjnej. Na trudniejszym materiale rezultaty były niższe, choć dodanie dwóch pasywnych warstw dyfrakcyjnych podnosiło skuteczność bez dokładania kolejnego aktywnego procesora.
Autorzy nie proponują więc, żeby na podstawie jednego sygnału automatycznie kasować film z internetu. Ich system ma działać jak bardzo szybkie pierwsze sito: przepuścić ogromny strumień materiałów, odsiać większość oczywistych przypadków i przesłać podejrzane nagrania do dokładniejszej analizy.
To interesujący kierunek także dlatego, iż dzisiejsze wykrywacze treści generowanych przez AI wciąż potrafią popełniać zaskakujące błędy. Im lepsze stają się generatory, tym mniej sensu ma szukanie jednego charakterystycznego artefaktu. UCLA próbuje więc wygrać z deepfake’ami w zupełnie inny sposób. Zamiast wrzucać coraz większą sieć neuronową na jeszcze większą kartę graficzną, część roboty oddaje fizyce.
*Źródło grafiki wprowadzającej: Mishek Munene, Canva Pro / Canva Pro

















