ChatGPT zostawi niewidzialny ślad. Już nie oszukasz tak łatwo

konto.spidersweb.pl 2 godzin temu

Unia wymusza zmiany, a OpenAI właśnie je wdraża. ChatGPT będzie zostawiał ślady.

Przez lata jednym z największych problemów generatywnej sztucznej inteligencji było to, iż po wygenerowaniu tekstu praktycznie nie dało się stwierdzić, czy napisał go człowiek, czy model AI. Owszem, powstawały różne narzędzia do wykrywania treści generowanych przez AI, ale ich skuteczność była co najmniej dyskusyjna. Teraz sytuacja zaczyna się zmieniać. OpenAI właśnie ogłosiło wdrożenie systemu znakowania tekstów generowanych przez ChatGPT i Codexa dla użytkowników z Unii Europejskiej.

Pokażcie, skąd pochodzi ten tekst

2 sierpnia zaczęły obowiązywać nowe przepisy dotyczące przejrzystości systemów AI wynikające z unijnego AI Act. Regulacje zakładają, iż określone treści generowane przez sztuczną inteligencję powinny zawierać oznaczenia umożliwiające ich identyfikację. Celem jest walka z dezinformacją, manipulacją, podszywaniem się pod inne osoby i coraz powszechniejszym problemem zalewania Internetu syntetycznymi treściami.

Przepisy nie wymagają umieszczenia na każdym wygenerowanym akapicie wielkiego napisu „Wygenerowano przez AI”. Chodzi raczej o identyfikację techniczną, możliwą do odczytania przez narzędzia i systemy informatyczne. Innymi słowy, człowiek niekoniecznie zobaczy jakiekolwiek oznaczenie, ale odpowiednie oprogramowanie powinno móc wykryć, iż dany tekst został wygenerowany przez model sztucznej inteligencji.

Nowa technologia OpenAI nosi nazwę textGrain. Firma opisuje ją jako system dodający do generowanego tekstu niewidoczny statystyczny sygnał ukryty w sposobie doboru słów przez model. Następnie specjalny detektor analizuje fragment tekstu i próbuje ustalić, czy znajduje się w nim znak wodny pochodzący od OpenAI. Brzmi trochę jak cyfrowa steganografia. Nie ma tu żadnych ukrytych znaków, dodatkowych spacji czy egzotycznych symboli. Zamiast tego model w subtelny sposób preferuje określone warianty słów lub konstrukcji językowych, pozostawiając charakterystyczny wzorzec możliwy do wykrycia przez odpowiednie narzędzie.

Wykres przedstawia wyniki wykrywania odpowiedzi opatrzonych znakiem wodnym na pytania z dziedziny matematyki i psychologii. Skuteczność wykrywania rośnie wraz z długością tekstu, jednak jest ogólnie znacznie niższa w przypadku treści o ograniczonej swobodzie doboru słów, takich jak teksty matematyczne

Najważniejsze jest jednak to, iż użytkownik nie zobaczy różnicy. Z perspektywy osoby korzystającej z ChatGPT tekst ma wyglądać dokładnie tak samo jak dotychczas. Zmiana zachodzi na poziomie statystycznym i jest praktycznie nieodczuwalna dla człowieka. To rozwiązanie przypomina stosowane już wcześniej techniki znakowania obrazów, filmów czy plików audio. Różnica polega na tym, iż tekst jest znacznie trudniejszym medium. Wystarczy kilka ręcznych poprawek, parafraza albo przepisanie fragmentów własnymi słowami, by skuteczność wykrywania zaczęła gwałtownie spadać. I właśnie dlatego OpenAI bardzo ostrożnie opisuje możliwości nowego systemu.

Sama firma przyznaje: to nie jest cudowna technologia

Firma otwarcie przyznaje, iż tekstowe znaki wodne są przez cały czas wczesną technologią mającą poważne ograniczenia. choćby jeżeli system dobrze radzi sobie w warunkach laboratoryjnych to nie oznacza to automatycznie równie wysokiej skuteczności podczas normalnego użytkowania. OpenAI podkreśla, iż wykrywanie może generować zarówno fałszywe alarmy, jak i przeoczenia. Sam fakt wykrycia znaku wodnego nie mówi praktycznie nic o autorstwie tekstu, odpowiedzialności za jego treść czy prawdziwości zawartych w nim informacji.

Edycja może znacząco osłabić siłę znaku wodnego. Wykres ten przedstawia, jak zastąpienie 10 proc. lub 25 proc. słów w tekście wpływa na skuteczność wykrywania

To bardzo ważne zastrzeżenie. W debacie publicznej regularnie pojawiają się pomysły, by „wykrywacze AI” wykorzystywać w szkołach, na uczelniach czy w procesach rekrutacyjnych jako niepodważalny dowód korzystania z modeli językowych. OpenAI przypomina, iż technologia po prostu do tego się nie nadaje. o ile detektor wykryje znak wodny to oznacza to jedynie, iż w tekście znaleziono sygnały charakterystyczne dla systemu OpenAI. Nie oznacza to, iż tekst został napisany wyłącznie przez AI. Nie oznacza też, iż człowiek nie dokonał później rozległych zmian. W praktyce jest to raczej wskazówka niż wyrok.

Dlaczego tylko Europa?

Przez najbliższe tygodnie niewidzialne oznaczenia mają pojawić się wyłącznie w kwalifikujących się odpowiedziach ChatGPT i Codexa generowanych dla użytkowników z Unii Europejskiej. Jednocześnie klienci korzystający z API OpenAI na całym świecie będą mogli samodzielnie zdecydować, czy chcą aktywować znakowanie treści. Funkcja pozostanie domyślnie wyłączona. To bardzo wymowna decyzja.

Sam znak wodny jest tylko częścią znacznie większej układanki, którą branża określa mianem „provenance”, czyli śledzenia pochodzenia treści. OpenAI od dłuższego czasu rozwija technologie pozwalające identyfikować obrazy, dźwięki i inne materiały generowane przez AI. Firma wykorzystuje między innymi standard C2PA, który pozwala zapisywać metadane opisujące pochodzenie plików.

Dla zwykłego internauty brzmi to mało ekscytująco, ale w perspektywie kilku lat może okazać się jednym z najważniejszych technologicznych frontów walki z dezinformacją. Internet coraz bardziej przypomina środowisko, w którym praktycznie każdy obraz, nagranie audio, film czy tekst może być wygenerowany przez maszynę. Samo rozpoznawanie treści „na oko” przestaje mieć sens. Potrzebne stają się więc mechanizmy pozwalające ustalić źródło materiału jeszcze zanim trafi on do mediów społecznościowych, wyszukiwarki czy aplikacji komunikacyjnych.

Problem polega na tym, iż nie istnieje rozwiązanie idealne. Metadane można usuwać a znaki wodne można próbować obchodzić – a teksty można przepisywać i parafrazować. Dlatego cała branża szuka dziś raczej zestawu wzajemnie uzupełniających się metod niż jednego magicznego sposobu identyfikacji treści AI. przez cały czas bezskutecznie.

*Grafika otwierająca wygenerowana dzięki AI

Idź do oryginalnego materiału