GAN: sieci generatywne i DeepNude
GAN to para sieci — generator i dyskryminator — uczących się przez rywalizację. Wyjaśniamy pracę Goodfellowa z 2014 r., odmiany i rolę GAN w historii DeepNude.
Czym jest GAN i jak działa rywalizacja dwóch sieci
GAN (Generative Adversarial Network, generatywna sieć przeciwstawna) to architektura zaproponowana przez Goodfellowa i in. w 2014 r., w której dwie sieci neuronowe uczą się jednocześnie: generator tworzy próbki, a dyskryminator ocenia, czy są prawdziwe. Rywalizacja poprawia obie strony, aż generator wytwarza obrazy nieodróżnialne od danych treningowych.
| Parametr | Wartość · źródło (data dostępu) |
|---|---|
| Rodzaj | generatywny model przeciwstawny (dwie sieci, gra minimax) · Goodfellow i in., 2014 |
| Zastosowanie | synteza twarzy (StyleGAN), tłumaczenie obraz→obraz (pix2pix, CycleGAN), superrozdzielczość, wczesne deepfake · arXiv 1812.04948 |
| Ryzyko | pierwsza generacja deepfake i aplikacja DeepNude (2019) oparta na pix2pix · Motherboard/Vice, 2019 |
| Standard / organizacja | brak normy; publikacje NeurIPS/CVPR; wyniki podlegają art. 50 AI Act jak każda treść syntetyczna · EUR-Lex |
| Ograniczenia | niestabilny trening, zapadanie modów, mniejsza różnorodność niż w dyfuzji · Dhariwal i Nichol, 2021 |
| Rok | 2014 — GAN; 2016 — pix2pix; 2018 — StyleGAN; 2019 — DeepNude; 2021 — dyfuzja przewyższa GAN-y · arXiv 1611.07004 |
Stan na 08.09.2026. Wpis ma charakter informacyjny i nie zawiera instrukcji użycia narzędzi; to nie jest porada prawna.
Rodzaj
Dwie sieci w grze — generator uczy się oszukiwać dyskryminator, dyskryminator uczy się wykrywać podróbki.
Zastosowanie
Synteza i translacja obrazów — realistyczne twarze, zmiana stylu, kolorowanie, a w 2019 r. — aplikacja DeepNude.
Ryzyko
Pierwsze masowe deepfake — GAN-y udowodniły, że syntetyczny intymny wizerunek da się wytworzyć jednym kliknięciem.
Standard / organizacja
Społeczność badawcza — architektura opisana otwarcie; regulacja zastosowań w AI Act i kodeksie karnym.
Rok
2014 — publikacja Goodfellowa i in.; 2019 — DeepNude; 2021 — początek dominacji modeli dyfuzyjnych.
Jak działa generative adversarial network
Generator dostaje losowy wektor i produkuje obraz. Dyskryminator dostaje na przemian obrazy prawdziwe i wygenerowane i uczy się je rozróżniać. Błąd dyskryminatora staje się sygnałem dla generatora: im lepiej oszukuje, tym mniejszą karę otrzymuje. Goodfellow i in. sformułowali to jako grę minimax dwóch graczy (arXiv 1406.2661).
W stanie równowagi dyskryminator zgaduje losowo, a rozkład generatora pokrywa się z rozkładem danych. W praktyce trening jest niestabilny: sieci mogą oscylować, a generator — „zapaść się” do kilku wzorów (mode collapse). Stąd dziesiątki wariantów funkcji straty i architektur opracowanych w latach 2015–2020.
Najbardziej znane odmiany to StyleGAN, generujący fotorealistyczne twarze o wysokiej rozdzielczości (Karras i in., 2018), pix2pix — translacja obraz→obraz na sparowanych danych (Isola i in., 2016) oraz CycleGAN, uczący się translacji bez par (Zhu i in., 2017).
GAN sieci neuronowe w historii DeepNude
W czerwcu 2019 r. anonimowy autor opublikował aplikację DeepNude, która na podstawie zdjęcia ubranej kobiety generowała syntetyczny obraz nagości. Według relacji Motherboard aplikacja opierała się na pix2pix i została wycofana przez twórcę po kilku dniach, po fali krytyki (Vice, 27.06.2019).
Wycofanie nie zatrzymało zjawiska: kod krążył dalej, a pomysł przejęły serwisy w przeglądarce i boty w komunikatorach. Ograniczenia GAN-ów — słaba jakość na nietypowych pozach, jeden typ ciała, artefakty — znikały wraz z przejściem branży na modele dyfuzyjne. Pełną historię opisuje hasło DeepNude i wpis o historii DeepNude.
GAN-y wciąż występują w niektórych komponentach: modułach superrozdzielczości, korektorach twarzy i części narzędzi do zamiany twarzy. Jednak jako główny silnik generatorów treści dla dorosłych zostały wyparte.
GAN kontra dyfuzja — dlaczego branża zmieniła architekturę
W 2021 r. Dhariwal i Nichol wykazali, że modele dyfuzyjne przewyższają GAN-y w standardowych miarach jakości i różnorodności (arXiv 2105.05233). Dyfuzja trenuje stabilnie, łatwo przyjmuje warunek tekstowy i obrazowy, a jej otwarte implementacje można dostrajać niewielkim kosztem.
GAN generuje obraz w jednym przebiegu, więc jest szybszy w inferencji — dlatego wciąż bywa używany tam, gdzie liczy się czas rzeczywisty, np. w filtrach wideo. W zadaniach edycji zdjęcia, gdzie liczy się wierność kontekstowi, wygrała dyfuzja z mechanizmami inpaintingu i img2img.
GAN a prawo i ocena narzędzi
Prawo nie rozróżnia architektur: intymny wizerunek istniejącej osoby wygenerowany GAN-em podlega art. 191a KK tak samo jak wynik dyfuzji (ISAP), a każda treść syntetyczna przedstawiająca osobę wymaga od 2 sierpnia 2026 r. ujawnienia zgodnie z art. 50 ust. 4 AI Act (EUR-Lex). Definicję deepfake w rozporządzeniu omawia hasło deepfake.
W recenzjach architektura jest informacją drugorzędną — liczą się filtry wieku i zgody, polityka retencji zdjęć i oznaczanie wyników. Testy prowadzimy na materiałach syntetycznych zgodnie z zasadami odpowiedzialnego użycia; kryteria opisuje metodyka ocen.
Powiązane narzędzia, które recenzujemy
Współczesne narzędzia rzadko opierają się na GAN-ach, ale ich historia zaczyna się od DeepNude. Poniżej materiały porządkujące ten kontekst i recenzje narzędzi obecnej generacji.
- Ainudez — recenzja narzędzia obecnej generacji na modelach dyfuzyjnych.
- SwapFaces AI — zamiana twarzy — technika, w której komponenty GAN wciąż występują.
- DeepNude — historia i co dalej — od aplikacji z 2019 r. do współczesnych serwisów.
Źródła
Wpis opiera się na publikacjach naukowych, dokumentacji standardów i tekstach aktów prawnych; daty dostępu podano przy każdym źródle. Redakcja nie linkuje do wag modeli ani dystrybucji oprogramowania i nie udziela porad prawnych.
- Goodfellow i in., „Generative Adversarial Networks”, arXiv 1406.2661 (2014) — dostęp 08.09.2026.
- Isola i in., „Image-to-Image Translation with Conditional Adversarial Networks” (pix2pix), arXiv 1611.07004 (2016) — dostęp 08.09.2026.
- Karras, Laine, Aila, „A Style-Based Generator Architecture for Generative Adversarial Networks” (StyleGAN), arXiv 1812.04948 (2018) — dostęp 08.09.2026.
- Zhu i in., „Unpaired Image-to-Image Translation using Cycle-Consistent Adversarial Networks” (CycleGAN), arXiv 1703.10593 (2017) — dostęp 08.09.2026.
- Dhariwal, Nichol, „Diffusion Models Beat GANs on Image Synthesis”, arXiv 2105.05233 (2021) — dostęp 08.09.2026.
- Motherboard/Vice — „This Horrifying App Undresses a Photo of Any Woman With a Single Click” (26–27.06.2019) — dostęp 08.09.2026.
- Rozporządzenie (UE) 2024/1689 (AI Act) — art. 3 pkt 60 i art. 50, EUR-Lex — dostęp 08.09.2026.
- Kodeks karny — art. 191a, ISAP — dostęp 08.09.2026.
Najczęstsze pytania
Krótkie odpowiedzi redakcji; szczegóły — w źródłach powyżej.
Co to jest GAN w prostych słowach?
To dwie sieci neuronowe uczące się przez rywalizację: generator tworzy obrazy, a dyskryminator ocenia, czy są prawdziwe. Z czasem generator tworzy próbki nieodróżnialne od danych. Architekturę opisał Goodfellow z zespołem w 2014 r.
Czy DeepNude działał na GAN?
Tak. Według relacji Motherboard z czerwca 2019 r. aplikacja opierała się na pix2pix — odmianie GAN do translacji obraz→obraz. Twórca wycofał ją po kilku dniach, ale kod i pomysł rozprzestrzeniły się dalej.
Czy dzisiejsze narzędzia undress używają GAN-ów?
Głównie nie. Od 2021–2022 r. branża przeszła na modele dyfuzyjne, które trenują stabilniej i dają lepszą jakość. GAN-y pozostały w komponentach pomocniczych, np. superrozdzielczości i części narzędzi do zamiany twarzy.
Czym GAN różni się od modelu dyfuzyjnego?
GAN generuje obraz w jednym przebiegu przez rywalizację dwóch sieci; bywa niestabilny w treningu. Dyfuzja odszumia obraz iteracyjnie, trenuje stabilnie i łatwiej przyjmuje warunki tekstowe i obrazowe.
Czy prawo traktuje obrazy z GAN inaczej?
Nie. Art. 191a KK i art. 50 AI Act dotyczą efektu — intymnego wizerunku lub deepfake — niezależnie od architektury. Wynik GAN-a i modelu dyfuzyjnego podlegają tym samym przepisom.