ChatGPT na smartfonie.
ChatGPT będzie musiał się przedstawić. Fot. Matheus Bertelli / Pexels.com

ChatGPT ma zacząć zostawiać w swoich tekstach niewidzialny ślad. OpenAI szykuje system, który pozwoli sprawdzić, czy dłuższa treść została (prawdopodobnie) wygenerowana przez AI. Brzmi jak koszmar dla internetowych "slopperów", ale jest pewien haczyk.

REKLAMA

"W odpowiedzi na wymogi regulacyjne UE rozszerzamy nasze podejście do oznaczania pochodzenia treści, obejmując nim również tekst" – poinformował 5 października profil firmy OpenAI odpowiedzialnej m.in. za ChatGPT. Oznacza to, że ekipa twórcy narzędzia – Sama Altmana – podąża za Anthropic w realizacji unijnego AI Act.

Na wzór Claude'a, który podpisuje niewidzialnym znakiem treści AI, nowość w ChatGPT ma docelowo pomóc użytkownikom w zrozumieniu, kiedy treść została wygenerowana lub zmodyfikowana za pomocą modelu OpenAI.

ChatGPT w tekście będzie musiał się ujawnić

OpenAI deklaruje, że "chce zapewnić wybór użytkownikom tam, gdzie to możliwe", nie precyzuje jednak, co tak naprawdę ma na myśli. Już teraz klienci firmy mogą włączyć funkcję znakowania wodnego dla wybranych modeli.

Jasny jest za to sposób działania proponowanego rozwiązania. Tekstowy znak wodny ma pozwolić na udzielenie odpowiedzi na pytanie: "Czy ten tekst został prawdopodobnie wygenerowany przez AI?" Podobnie jak Anthropic w przypadku Claude'a, OpenAI zarzeka się, że watermarking nie wpływa na możliwości, styl ani szybkość działania modeli ChatGPT.

"Stosowanie znaków wodnych ma swoje ograniczenia. Często są one niewykrywalne, zwłaszcza w przypadku krótkich fragmentów tekstu. Przeredagowanie lub przetłumaczenie tekstu może całkowicie usunąć taki znak wodny" – twierdzi OpenAI i dodaje, że z tego powodu dostęp do narzędzia weryfikującego wykorzystanie AI dostaną "zweryfikowani badacze".

Jednocześnie OpenAI wprost mówi o ograniczeniach technologicznych, w komunikacie firmy czytamy:

  1. Znak wodny nie przesądza o kwestiach własności ani odpowiedzialności. Nie określa, kto jest właścicielem tekstu, czy jego wykorzystanie było zgodne z prawem, czy wymagane było jego ujawnienie, ani kto ponosi za niego odpowiedzialność.
  2. Znak wodny nie weryfikuje prawdziwości informacji. Nie informuje, czy tekst jest prawdziwy, wprowadzający w błąd, szkodliwy czy też przedstawiony we właściwym kontekście.
  3. Brak wykrytego znaku wodnego nie stanowi dowodu na autorstwo człowieka. Tekst wygenerowany za pomocą narzędzi OpenAI może być zbyt krótki, poddany edycji lub przetłumaczony, co uniemożliwia skuteczne wykrycie znaku.

Jak rozwiązanie OpenAI będzie działać w praktyce?

Podobnie jak w przypadku zapowiedzi Anthropic – na narzędzia do weryfikacji użytku AI w tekście przyjdzie nam długo poczekać. Docelowo ma ono pozwolić na weryfikowanie wykorzystania sztucznej inteligencji w dość długich kreacjach (narzędzie osiąga użyteczną skuteczność od około 400 tokenów, czyli około 200-300 słów).

Dalsza część artykułu poniżej.

Jednocześnie edycja treści generowanej z ChatGPT może prowadzić do zaburzenia działania modelu weryfikacyjnego. OpenAI podaje konkretne wartości: zamiana 10 proc. słów na synonimy obniża skuteczność detekcji z 92 proc. do 66 proc., a przy 25 proc. do 17 proc.

Co ciekawe, OpenAI zwraca uwagę, że w przypadku psychologii, gdzie możliwość wykorzystania języka jest bardziej swobodna niż w przypadku matematyki, znakowanie tekstu będzie działać skuteczniej.

W praktyce narzędzie może pozwolić na weryfikowanie "AI Slopu", czyli odpowiedzi przeklejonych bezpośrednio z narzędzia. Jest to o tyle istotne, że ChatGPT jest flagowym narzędziem do generowania wpisów w mediach społecznościowych. Jego styl narracyjny zdobył uznanie tzw, slopperów, którzy systematycznie zaśmiecają internet mało kreatywną treścią. Zmiany nie sprawią, że problem zniknie, ale masowe generowanie treści AI będzie wiązało się z dużym ryzykiem wykrycia. Każda dodatkowa kłoda pod nogi spamującym profilom może zredukować szkodliwość sztucznej inteligencji w przestrzeni publicznej. Jednocześnie ryzyko "fałszywych pozytywów" dalej występuje (OpenAI prezentuje wyniki przy docelowym progu 1 proc. takich wskazań).

Podobnie jak w przypadku Claude'a, intensywna ingerencja w tekst przez model AI (np. w ramach rozbudowanej korekty lub opracowania treści na bazie autorskiego szkicu), może być flagowana jako wygenerowana przez ChatGPT.