C:\min_bild_ai\archive.exe
_
x

min_bild_ai

Komplett arkiv över en skulpturgenerator tränad från grundenComplete archive of a from-scratch sculpture generator
Konstnär:Artist: Nadja Barenje
Projekt:Project: examensarbete BFA, KonstfackMFA thesis work, Konstfack University of Arts, Crafts and Design
Period:Period: November 2025 - April 2026
Experiment:Experiments: 46 dokumenterade körningar i 8 faser46 documented runs across 8 phases
Total GPU-tid:Total GPU time: ~400 timmar på ett enda konsumentkort~400 hours on a single consumer graphics card
Hårdvara:Hardware: NVIDIA GTX 1660 Super (6 GB VRAM, ~6.5 TFLOPS FP32)
Dataset:Dataset: 7 843 fotografier från konstnärens kamerarulle (256x256 px)7,843 photographs from the artist's camera roll (256x256 px)
Princip:Principle: allt tränat från grunden. Inga förtränade modeller. Ingen extern data.Everything trained from scratch. No pretrained models. No external data.
Systemfrysningar överlevda:System freezes survived: 2 (krävde hårt omstart och checkpoint-återhämtning)2 (requiring hard power-off and checkpoint recovery)
"En skulptur är allt som är centrerat i bilden,
med definierade kanter och figur-bakgrundsdelning."
"A sculpture is anything centered in the image,
with defined edges and figure-ground separation."

Det är en STRUKTURELL definition, inte en semantisk.This is a STRUCTURAL definition, not a semantic one.
Maskinen måste lära sig form, inte mening.The machine must learn form, not meaning.

Inga förtränade modeller. Inga genvägar. Inga kompromisser.No pretrained models. No shortcuts. No compromises.
Efter 400 timmar och 46 experiment är svaret ingen arkitektur.
Svaret är ett curriculum.
After 400 hours and 46 experiments, the answer is not an architecture.
The answer is a curriculum.
Tidslinje: 8 månader, 400 timmar, 46 experimentTimeline: 8 months, 400 hours, 46 experiments
I: StyleGAN2 x17
CRASH
II: Diffusion x5
III: Progressive x5
IV: Cond x9
V: VAE x3
VI: Token x6
VII: Return
FasPhaseArkitekturArchitectureExperimentExperimentsGPU-tidGPU TimeNyckelresultatKey Result
IStyleGAN217~150hAll mode-collapse. 30 M params för många för 7 K bilder.All mode-collapsed. 30M params too many for 7K images.
IIDiffusion (pixel, latent, edge, slot)5~80hMSE medelvärdar till datasetet. Bara texturer, inga objekt.MSE averages to dataset mean. Only textures, no objects.
IIIProgressive GAN5~15hGENOMBROTT. Former vid 128x128. Figur-bakgrundsdelning.BREAKTHROUGH. Forms at 128x128. Figure-ground separation.
IVConditional GAN / AC-GAN9~35hKategorier smälter ihop. Diskriminatordominans.Categories melt together. Discriminator dominance.
VVQ-VAE3~10hFungerande tokenizer (loss 0,0009). Nästan perfekt rekonstruktion.Working tokenizer (loss 0.0009). Near-perfect reconstruction.
VIToken Transformer / MaskGIT6~80hTokenobalans: 4 av 512 koder = 76,5 % av datan. Mode-collapse.Token imbalance: 4 of 512 codes = 76.5% of data. Mode collapse.
VIIProgressive GAN (return)2~5hBekräftat bäst. Fortsatte till epoch 100.Confirmed best. Continued to epoch 100.
Efter 400 timmar genom alla stora generativa arkitekturfamiljer (GAN, Diffusion, VAE, Transformer, Flow Matching) är det centrala fyndet: "Arkitektur löser INTE dataproblem." 7 000 heterogena bilder + träning från grunden + ovillkorlig generering = ett matematiskt underbestämt system. Den enda arkitektur som lyckades var den som bröt ner problemet i ett curriculum: progressiv tillväxt från 4×4 till 128×128, struktur lärd grovt innan fint.After 400 hours across every major generative architecture family (GAN, Diffusion, VAE, Transformer, Flow Matching), the central finding: "Architecture does NOT solve data problems." 7,000 heterogeneous images + from-scratch training + unconditional generation = a mathematically underdetermined system. The only architecture that succeeded was the one that decomposed the problem into a curriculum: progressive growing from 4x4 to 128x128, learning coarse structure before fine detail.

Vad fungeradeWhat worked

  • Progressiv tillväxt (grovt-till-fint curriculum)Progressive growing (coarse-to-fine curriculum)
  • VQ-VAE encoder/decoder (0,0009 total loss)VQ-VAE encoder/decoder (0.0009 total loss)
  • Små modeller (~4,5 M params) på liten dataSmall models (~4.5M params) on small data
  • WGAN-GP loss (stabilare än vanilla GAN)WGAN-GP loss (more stable than vanilla GAN)
  • Watchdog-skript för kraschåterställningWatchdog scripts for crash recovery

Vad misslyckadesWhat failed

  • StyleGAN2 (30 M params = overfitting)StyleGAN2 (30M params = overfitting)
  • Pixeldiffusion (MSE medelvärdar allt)Pixel-space diffusion (MSE averages everything)
  • Ovillkorlig tokengenerering (underbestämd)Unconditional token generation (underdetermined)
  • Multi-klass-konditionering (för få per klass)Multi-class conditioning (too few per class)
  • Kant-först-ansats (för gles för GAN)Edge-first approaches (too sparse for GAN)

Principer som hölls hela vägenPrinciples maintained throughout

  • INGA förtränade modeller (CLIP, Inception, SD, LoRA)NO pretrained models (CLIP, Inception, SD, LoRA)
  • INGEN "stämningsgenerator"-kompromiss accepteradesNO "mood generator" compromises accepted
  • INGA upprepade experiment (varje måste vara nytt)NO repeated experiments (each must be novel)
  • Allt lärt enbart från konstnärens dataEverything learned from the artist's data alone

HårdvarubegränsningarHardware constraints

  • GTX 1660 Super: 6 GB VRAM, ~6.5 TFLOPS
  • Max batch-storlek: 12 (större orsakar OOM-frysning)Max batch size: 12 (larger causes OOM freeze)
  • GPU-tempgräns: 80°C (watchdog avbryter processen)GPU temp limit: 80C (watchdog kills process)
  • 2 systemfrysningar överlevda via checkpoint-återhämtning2 system freezes survived via checkpoint recovery
Datasetet: 7 843 fotografier från ett konstnärslivThe Dataset: 7,843 photographs from an artist's life

Hela projektet är byggt på ett enda dataset: 7 843 fotografier hämtade från konstnärens kamerarulle, skalade till 256×256 pixlar. Det är den enda träningsdatan. Inga externa bilder, ingen augmentering från andra källor, ingen syntetisk data.The entire project is built on a single dataset: 7,843 photographs extracted from the artist's camera roll, resized to 256x256 pixels. This is the only training data. No external images, no augmentation from other sources, no synthetic data.

Datasetet är radikalt heterogent. Det innehåller allt en konstnär fotograferar under år av praktik: glaskonstverk i olika stadier, keramiska verk, metallgjutningar, studiomiljöer, galleriinstallationer, utställningsdokumentation, närbild på materialytor, textdokument, skärmdumpar, privata fotografier, natur, gatufynd, referensbilder och vardag.The dataset is radically heterogeneous. It contains everything an artist photographs over years of practice: glass sculptures in various stages of completion, ceramic works, metal castings, studio environments, gallery installations, exhibition documentation, close-ups of material surfaces, text documents, screenshots, personal photographs, nature, objects found on the street, reference images, and everyday life.

Den heterogeniteten är både den avgörande utmaningen och projektets filosofiska kärna. En förtränad modell (Stable Diffusion, DALL-E) för med sig sitt eget visuella ordförråd inlärt från miljarder internetbilder. Att träna från grunden på just den här samlingen betyder att modellen bara kan lära sig från den här specifika visuella världen. Varje textur den genererar, varje färg den väljer, varje form den producerar kommer uteslutande från Nadjas fotografiska praktik.This heterogeneity is both the defining challenge and the philosophical core of the project. A pretrained model (Stable Diffusion, DALL-E) would impose its own visual vocabulary learned from billions of internet images. Training from scratch on this specific collection means the model can only learn from this particular visual world. Every texture it generates, every color it chooses, every form it produces comes exclusively from Nadja's photographic practice.

Datasetvarianter använda i experimentenDataset variants used across experiments

DatasetvariantenDataset variantBilderImagesStorlekSizeSyftePurpose
dataset_v15_actual (primary)7,8432.0 GBFullständig originalextraktion från kamerarullenFull original camera roll extraction
dataset_no_gray6,8061.9 GBGråskale-/svartvita bilder borttagnaRemoved grayscale/B&W images
dataset_isolated4,133471 MBBilder med isolerade objekt mot bakgrunderImages with isolated objects on backgrounds
dataset_strict1,444176 MBStriktast kurerade: bara centrerade objektMost strictly curated: centered objects only
dataset_curated_v2750390 MBHandplockade bästa skulpturbilderHand-picked best sculpture images
dataset_curated917120 MBFörsta kureringsvändanFirst curation pass
curated_sculptures30090 MBDe 300 mest skulpturliknande bildernaTop 300 sculpture-like images
dataset_edges7,501124 MBSobel-kantkartor av alla bilderSobel edge maps of all images
dataset_glass_only6723 MBGlasobjekt enbart (för få för träning)Glass objects only (too few for training)
dataset_glass_v211643 MBUtökat glasset (fortfarande för få)Expanded glass set (still too few)

FörprocesseringspipelinePreprocessing pipeline

Utöver råbilderna gjordes extensiv feature-extraktion för att stödja konditionerad generering och analys:Beyond the raw images, extensive feature extraction was performed to support conditional generation and analysis:

  • Featurevektorer (6,6 GB): 32-dimensionella deskriptorer per bild inklusive färgstatistik, kantdensitet, symmetri och texturmåttFeature vectors (6.6 GB): 32-dimensional descriptors per image including color statistics, edge density, symmetry, and texture measures
  • SAM-segmenteringsmasker (35 MB): automatisk objektsegmentering med Segment Anything (applicerat på datan, inte i modellträningen)SAM segmentation masks (35 MB): Automatic object segmentation using Segment Anything (applied to data only, not to model training)
  • Kantkartor (124 MB): Sobel-filtrerade versioner för kantmedvetna träningsexperimentEdge maps (124 MB): Sobel-filtered versions for edge-aware training experiments
  • VQ-VAE-tokens (246 MB): förberäknade diskreta tokenrepresentationer för transformerexperimentVQ-VAE tokens (246 MB): Pre-computed discrete token representations for transformer experiments

Det fundamentala dataproblemetThe fundamental data problem

Moderna generativa modeller tränas vanligtvis på miljontals bilder (FFHQ: 70 K ansikten, LAION: 5 miljarder bild-textpar, ImageNet: 14 M bilder). Det här projektet använder 7 843 heterogena bilder. Lyckad träning från grunden i den skalan kräver antingen: (a) ett mycket homogent dataset, (b) en väldigt liten modell, eller (c) ett träningscurriculum som bryter ner problemet. Projektet hittade alternativ (c).Modern generative models are typically trained on millions of images (FFHQ: 70K faces, LAION: 5B image-text pairs, ImageNet: 14M images). This project uses 7,843 heterogeneous images. Successful from-scratch training at this scale requires either: (a) a very homogeneous dataset (all similar images), or (b) a very small model, or (c) a training curriculum that decomposes the problem. The project discovered option (c).

Datasetet sätter taket. Ingen arkitektur kan generera objekt som datan inte innehåller tillräckligt med exempel på. Glass-only-träning (67–116 bilder) ger omedelbart mode-collapse. Det fulla heterogena datasetet ger varierade men ostrukturerade resultat. Bara strikt kuration + progressiv träning producerade skulpturala former.The dataset defines the ceiling. No architecture can generate objects the data doesn't contain enough examples of. Glass-only training (67-116 images) immediately mode-collapses. The full heterogeneous dataset produces diverse but unstructured outputs. Only strict curation + progressive training produced sculptural forms.
Fas I: StyleGAN2 (EXP-001 till EXP-017)Phase I: StyleGAN2 (EXP-001 to EXP-017) 17 EXPERIMENT MISSLYCKADES17 EXPERIMENTS FAILED

Period: november 2025–februari 2026 | Längd: ~150 timmar | Experiment: 17Period: November 2025 - February 2026 | Duration: ~150 hours | Experiments: 17

Projektet började med StyleGAN2, den dominerande GAN-arkitekturen för högkvalitativ bildgenerering. Resonemanget: StyleGAN2 genererar fotorealistiska 1024×1024-ansikten från 70 000 justerade bilder (FFHQ). Det borde klara av att generera 256×256-skulpturer från 7 843 bilder.The project began with StyleGAN2, the dominant GAN architecture for high-quality image generation. The reasoning: StyleGAN2 generates photorealistic 1024x1024 faces from 70,000 aligned images (FFHQ). Surely it can generate 256x256 sculptures from 7,843 images.

Det klarade det inte. Alla 17 varianter drabbades av samma tre problem:It could not. All 17 variants suffered the same three problems:

  1. Mode-collapse: Generatorn konvergerar mot att producera samma bild upprepade gånger, eller ett litet kluster av nästan identiska utdata. Diskriminatorn lär sig för snabbt och generatorn kan inte återhämta sig.Mode collapse: The generator converges on producing the same image repeatedly, or a small cluster of near-identical outputs. The discriminator learns too quickly and the generator cannot recover.
  2. Diskriminatordominans: Med få träningsbilder memorerar diskriminatorn datasetet och avvisar allt generatorn producerar. Det adversariala spelet blir ovinnerligt.Discriminator dominance: With few training images, the discriminator memorizes the dataset and rejects everything the generator produces. The adversarial game becomes unwinnable.
  3. Instabil träning: Loss-värden oscillerar våldsamt. Checkpoints från angränsande epoker ger radikalt olika kvalitetsnivåer. Ingen tillförlitlig konvergensbana.Unstable training: Loss values oscillate wildly. Checkpoints from adjacent epochs produce radically different quality levels. No reliable convergence trajectory.

Vad som testades i de 17 varianternaWhat was tested across 17 variants

VariantVariantModifieringModificationResultatResult
Standard StyleGAN2Standard-hyperparametrarDefault hyperparametersMode-collapse vid epoch 20Mode collapse by epoch 20
ADA (Adaptive Augmentation)Dataaugmentering i diskriminatornData augmentation in discriminatorFördröjd collapse, misslyckas ändåDelayed collapse, still fails
Reducerad modellReduced modelFärre kanaler, mindre mappningsnätverkFewer channels, smaller mapping networkSamma collapse med sämre kvalitetSame collapse with worse quality
Olika learning ratesVarious learning rates1e-3 to 1e-5 for G and DLångsammare collapse, samma utfallSlower collapse, same outcome
Olika batch-storlekarVarious batch sizes2, 4, 8, 12Batch 12 = VRAM-gräns. Ingen förbättring.Batch 12 = VRAM limit. No improvement.
R1 regularizationOlika gamma-värdenDifferent gamma valuesMarginell stabilitetsförbättringMarginal stability improvement
Path length regularizationJämnare latent rumSmoother latent spaceIngen synlig effektNo visible effect

StyleGAN2 har ungefär 30 miljoner parametrar. Med 7 843 träningsbilder är det ~3 800 parametrar per träningsbild. Jämförelsevis har FFHQ-träning ~430 parametrar per bild. Modellen har för många frihetsgrader i förhållande till de begränsningar datan ger.StyleGAN2 has approximately 30 million parameters. With 7,843 training images, that is ~3,800 parameters per training image. For comparison, FFHQ training has ~430 parameters per image. The model has too many degrees of freedom relative to the constraints provided by the data.

De 150 timmarna var inte bortkastade. De etablerade ett kritiskt negativt resultat: standard-GAN-arkitekturer designade för stora, homogena dataset kan inte skalas ner till små, heterogena genom att bara justera hyperparametrar. Den fundamentala arkitekturen måste ändras.The 150 hours spent here were not wasted. They established a critical negative result: standard GAN architectures designed for large, homogeneous datasets cannot be scaled down to small, heterogeneous ones by simply adjusting hyperparameters. The fundamental architecture must change.

STYLEGAN2 ARCHITECTURE Latent z (512-dim) --> Mapping Network (8 FC layers) --> w (512-dim) | +-------- Style modulation (AdaIN) -----------+ | Synthesis: 4x4 --> 8x8 --> 16x16 --> 32x32 --> 64x64 --> 128x128 --> 256x256 [Noise injection at every layer] [Skip connections + progressive growing] Total parameters: ~30,000,000 Training images: 7,843 Params per image: ~3,800 (FFHQ baseline: ~430) Result: MODE COLLAPSE in all 17 configurations
"GAN-arkitekturer har fundamentalt problem med discriminator-dominans pa sma dataset. Behover byta till icke-adversarial approach."
-- EXP-001-017, conclusion, February 2026
Mode-collapse i alla 17 varianter. Generatorn konvergerar mot datasettets medelvärde (ett suddigt brungrått snitt). Diskriminatorn memorerar det lilla datasetet och avvisar alla genererade samples. Ingen hyperparameterkonfiguration kan kompensera för det 7× sämre parameter-till-data-förhållandet jämfört med standard StyleGAN2-träning.Mode collapse across all 17 variants. The generator converges on producing the dataset mean (a blurry brownish-gray average). The discriminator memorizes the small dataset and rejects all generated samples. No hyperparameter configuration can compensate for the 7x worse parameter-to-data ratio compared to standard StyleGAN2 training.
En modell med 30 M parametrar kan inte lära sig meningsfull struktur från 7 843 heterogena bilder. Modell-till-data-förhållandet är viktigare än arkitektonisk sofistikering. Den insikten styrde alla efterföljande experiment mot mindre modeller.A 30M-parameter model cannot learn meaningful structure from 7,843 heterogeneous images. The model-to-data ratio is more important than architectural sophistication. This lesson guided all subsequent experiments toward smaller models.
Räddningen: systemfrysning och ärlig bedömning (7 februari 2026)The Rescue: System Freeze and Honest Assessment (February 7, 2026) SYSTEMKRASCHSYSTEM CRASH

Datum: 7 februari 2026, 23:45 | Händelse: Total systemfrysning under träningDate: February 7, 2026, 23:45 | Event: Complete system freeze during training

Under en latent diffusion-körning tog minnet slut och systemet frös totalt. Skärmen blev svart. Inget tangentbordssvar. Enda alternativet: håll strömknappen i 5 sekunder och hoppas att det senaste checkpointet sparades.During a latent diffusion training run, the system ran out of memory and froze completely. The screen went black. No keyboard response. The only option: hold the power button for 5 seconds and hope the last checkpoint was saved.

Det var inte den första frysningen. Dagen innan (6 februari) hade systemet också frusit vid epoch 8 av ett latent diffusion-experiment och förlorat 1,2 timmars träning. Orsaken: konturmedveten loss kombinerad med stor batch-storlek förbrukade alla 6 GB VRAM samtidigt, vilket utlöste ett out-of-memory-tillstånd som Linux-kärnan inte kunde återhämta sig från.This was not the first freeze. The previous day (February 6) the system had also frozen at epoch 8 of a latent diffusion experiment, losing 1.2 hours of training. The cause: contour-aware loss combined with a large batch size consumed all 6 GB of VRAM simultaneously, triggering an out-of-memory condition that the Linux kernel could not recover from.

Efter omstart genomfördes en grundlig räddningssession. Varje checkpoint undersöktes. Varje komponent utvärderades ärligt. Det resulterande dokumentet, RADDNINGSRAPPORT.md, är den mest ärliga bedömningen i projektets historia.After reboot, a comprehensive rescue session was conducted. Every checkpoint was examined. Every component was honestly evaluated. The resulting document, RADDNINGSRAPPORT.md, is the most honest assessment in the project's history.

Ärlig bedömning vid tidpunkten för räddningenHonest assessment at the time of rescue

KomponentComponentStatusStatusÄrlig utvärderingHonest evaluation
VAE v3 (Vaeana)FungerarWorkingMSE 0,0128, 11 M params, latent 8×32×32. God struktur, separationskvot 7,79.MSE 0.0128, 11M params, latent 8x32x32. Good structure, separation ratio 7.79.
NadjaEMBEDÖvertränadOvertrainedBäst vid epoch 20 (val_loss 2,88), sämre vid epoch 100 (3,50). Bara 14 % recall.Best at epoch 20 (val_loss 2.88), got worse by epoch 100 (3.50). Only 14% recall.
Latent DiffusionPlatåPlateauedEpoch 46/150, val_loss 0,3491, ingen förbättring sedan epoch 40.Epoch 46/150, val_loss 0.3491, no improvement since epoch 40.

Vad modellen kunde göraWhat the model could do

  • Generera texturer och materialliknande ytorGenerate textures and material-like surfaces
  • Svara på materialprompter: "glas" gav blå-transparenta toner, "metall" gav metalliska ytorRespond to material prompts: "glass" produced blue-transparent tones, "metal" produced metallic surfaces
  • Variera utdataintensitet via CFG-skalaVary output intensity via CFG scale

Vad modellen INTE kunde göraWhat the model could NOT do

  • Generera objekt eller skulpturer (inga konturer, ingen form)Generate objects or sculptures (no contours, no form)
  • Producera figur-bakgrundsdelning (allt var textur på textur)Produce figure-ground separation (everything was texture-on-texture)
  • Undvika textartefakter vid vissa promptkonfigurationerAvoid text artifacts at certain prompt configurations
  • Förbättras bortom epoch 40 (fundamental platå)Improve beyond epoch 40 (fundamental plateau)
"Projektet har natt en teknisk framgang men inte malet."
-- RADDNINGSRAPPORT.md, February 7, 2026, 23:45

Räddningsrapporten erbjöd fyra möjliga vägar framåt:The rescue report offered four possible paths forward:

  1. Acceptera som textur-/stämningsgenerator — omedelbart avvisat (bryter mot DEC-002)Accept as texture/mood generator -- immediately rejected (violates DEC-002)
  2. Kurera dataset till 500–1 000 fokuserade bilder — uppskattad tid 2–4 dagarCurate dataset to 500-1000 focused images -- estimated 2-4 days
  3. Lägg till förtränad backbone — avvisat (bryter mot DEC-001, from-scratch-principen)Add pretrained backbone -- rejected (violates DEC-001, from-scratch principle)
  4. Ny arkitektur (Slot Attention) — uppskattad tid 1–2 veckorNew architecture (Slot Attention) -- estimated 1-2 weeks

Frysningen ledde också till ny säkerhetsinfrastruktur: watchdog-skript som övervakar GPU-temperatur, VRAM-användning och system-RAM var 10:e sekund och automatiskt avslutar träningsprocessen innan systemet kan frysa. Maximalt 5 automatiska omstarter. Pausfunktion via en touch-fil. Dessa skript användes i varje efterföljande experiment.The freeze also led to new safety infrastructure: watchdog scripts that monitor GPU temperature, VRAM usage, and system RAM every 10 seconds, automatically killing the training process before the system can freeze. Maximum 5 automatic restarts. Pause functionality via a touch file. These scripts remained in use for every subsequent experiment.

Systemkrascher är inte bara tekniska olägenheter. De tvingar fram ärlighet. Räddningsrapporten var det första dokumentet som erkände att "projektet har nått teknisk framsteg men inte målet." Den ärligheten styrde om hela forskningsbanan mot progressiv tillväxt en vecka senare.System crashes are not just technical inconveniences. They force honest assessment. The rescue report was the first document that admitted "the project has achieved technical progress but not the goal." This honesty redirected the entire research trajectory toward progressive growing one week later.
Fas II: diffusionsmodeller (EXP-018 till EXP-022)Phase II: Diffusion Models (EXP-018 to EXP-022) MISSLYCKADESFAILED

Period: 6–13 februari 2026 | Längd: ~80 timmar | Experiment: 5Period: February 6-13, 2026 | Duration: ~80 hours | Experiments: 5

Efter GAN-misslyckandena vände projektet sig till diffusionsmodeller, som lär sig generera bilder genom att vända på en brusläggningsprocess. Till skillnad från GAN kräver diffusionsmodeller ingen adversarial träning, vilket borde göra dem stabilare på små dataset.After the GAN failures, the project turned to diffusion models, which learn to generate images by reversing a noise-adding process. Unlike GANs, diffusion models do not require adversarial training, which should make them more stable on small datasets.

EXP-018 Pixeldiffusion: En U-Net tränad att förutsäga brus i pixelrymden (256×256×3 = 196 608 dimensioner). Modellen minimerar MSE mellan förutsagt och faktiskt brus. Under 300 epoker lärde sig modellen förutsäga det genomsnittliga bruset och producerade bilder som konvergerade mot datasettets medelvärde: ett urblekt brungrått suddigt inget med ingen rumslig struktur. Det är matematiskt förväntat. MSE-minimering på heterogen data ger det statistiska genomsnittet.Pixel Diffusion: A U-Net trained to predict noise in pixel space (256x256x3 = 196,608 dimensions). The model minimizes mean squared error between predicted and actual noise. Over 300 epochs, the model learned to predict the average noise, producing images that converge on the dataset mean: a washed-out brownish-gray blur with no spatial structure. This is mathematically expected. MSE minimization on heterogeneous data produces the statistical average.

EXP-019 CLIP Diffusion: Försökte använda CLIP-embeddings för genereringsstyrning. Omedelbart övergiven. CLIP är förtränad på 400 miljoner internetbild-textpar. Att använda den skulle injicera visuell kunskap från utanför Nadjas dataset och fundamentalt bryta mot from-scratch-principen. Till och med att använda CLIP för utvärdering (FID-poäng kräver förtränad Inception) avvisades.CLIP Diffusion: Attempted to use CLIP embeddings for generation guidance. Immediately abandoned. CLIP is pretrained on 400 million internet image-text pairs. Using it would inject visual knowledge from outside Nadja's dataset, fundamentally violating the from-scratch principle. Even using CLIP for evaluation (FID scores require pretrained Inception) was rejected.

EXP-020 NadjaEMBED: En egenutvecklad materialklassificerare (11,8 M params) tränad från grunden på datasetet självt, sedan använd för att styra diffusion. Embeddingen lärde sig svaga materialassociationer (glas kontra metall: cosinuslikhet 0,028, korrekt lågt; glas kontra kristall: 0,318, korrekt liknande) men med bara 14 % recall. För brusigt för att styra genereringen meningsfullt. Utdatan var fortfarande suddiga texturer utan objektstruktur.NadjaEMBED: A custom material classifier (11.8M params) trained from scratch on the dataset itself, then used to guide diffusion. The embedding learned weak material associations (glass vs metal: cosine similarity 0.028, correctly low; glass vs crystal: 0.318, correctly similar) but with only 14% recall. Too noisy to guide generation meaningfully. The outputs were still blurry textures without object structure.

EXP-021 SlotDiffusion: Slot attention delar upp en scen i separata objekt-"slots" och rekonstruerar varje oberoende. Kombinerat med diffusion borde det lära sig objektnivågenerering. Slot attention designades dock för syntetiska dataset (CLEVR, MOVi) med tydliga, isolerade objekt mot enhetliga bakgrunder. Nadjas fotografier är komplexa, flerskiktade och saknar tydlig figur-bakgrundsgräns i de flesta bilder. Modellen kunde inte dekomponera något meningsfullt.SlotDiffusion: Slot attention decomposes a scene into separate object "slots" and reconstructs each independently. Combined with diffusion, it should learn object-level generation. However, slot attention was designed for synthetic datasets (CLEVR, MOVi) with clear, isolated objects on uniform backgrounds. Nadja's photographs are complex, multi-layered, and have no clear figure-ground boundary in most images. The model could not decompose anything meaningful.

EXP-022 Kant-först: Extrahera Sobel-kantkartor från alla bilder, träna en GAN på kantkartorna (som är enklare), sedan kolorera. Kantkartorna visade sig för glesa för GAN-träning. De flesta bilder har svaga eller diffusa kanter och kantkartorna kollapsade till nästan tomma bilder. En GAN tränad på mestadels tomma bilder producerar tomma bilder.Edge-First: Extract Sobel edge maps from all images, train a GAN on the edge maps (which are simpler), then colorize. The edge maps proved too sparse for GAN training. Most images have weak or diffuse edges, and the edge maps collapsed to near-empty images. A GAN trained on mostly-empty images produces empty images.

PIXEL DIFFUSION vs LATENT DIFFUSION PIXEL SPACE (EXP-018): Image (256x256x3) --[add noise]--> Noisy image --[U-Net]--> Predicted noise Output dimensions: 196,608 Problem: MSE over 196K dims with 7K images = learns the AVERAGE LATENT SPACE (attempted later): Image --[VAE Encoder]--> Latent (8x32x32) --[add noise]--> Noisy latent --[U-Net]--> Predicted noise Output dimensions: 8,192 (24x fewer) Still produces textures, not objects (the data problem persists) EDGE-FIRST (EXP-022): Image --[Sobel filter]--> Edge map --[GAN]--> Generated edges --[Colorize]--> Image Problem: Edge maps are mostly empty (sparse data for GAN training)
Pixelrymds-diffusion med MSE-loss på heterogen data konvergerar matematiskt mot datasettets medelvärde. Modellen lär sig förutsäga genomsnittsbrus och producerar genomsnittsbilder. Med 196 608 utdatadimensioner och 7 843 träningsexempel är systemet extremt underbestämt. Att reducera till 8 192 latenta dimensioner hjälper beräkningsmässigt men löser inte det semantiska problemet: datan är fortfarande för heterogen för ovillkorlig generering.Pixel-space diffusion with MSE loss on heterogeneous data mathematically converges on the dataset mean. The model learns to predict average noise, producing average images. With 196,608 output dimensions and 7,843 training examples, the system is wildly underdetermined. Reducing to 8,192 latent dimensions helps computationally but does not solve the semantic problem: the data is still too heterogeneous for unconditional generation.
Diffusionsmodeller är stabilare än GAN men möter samma fundamentala dataproblem. Stabilitet betyder inte kvalitet när datan inte kan begränsa utdarymden. Att gå till latent rymd (färre dimensioner) förbättrar hastigheten men inte det semantiska lärandet. Problemet är avsaknaden av struktur i träningssignalen.Diffusion models are more stable than GANs but face the same fundamental data problem. Stability does not equal quality when the data cannot constrain the output space. Moving to latent space (fewer dimensions) improves speed but not semantic learning. The problem is the lack of structure in the training signal.
Fas III: progressiv GAN (EXP-023 till EXP-026)Phase III: Progressive GAN (EXP-023 to EXP-026) GENOMBROTTBREAKTHROUGH

Period: 14–17 februari 2026 | Längd: ~15 timmar | Experiment: 5Period: February 14-17, 2026 | Duration: ~15 hours | Experiments: 5

Efter 22 misslyckade experiment och 230 timmars GPU-tid, en fundamentalt annorlunda ansats. Istället för att generera 256×256-bilder på en gång börjar modellen vid 4×4-upplösning och ökar gradvis: 4×4 → 8×8 → 16×16 → 32×32 → 64×64 → 128×128. Varje nivå tränas tills den är stabil innan nästa introduceras.After 22 failed experiments and 230 hours of GPU time, a fundamentally different approach. Instead of generating 256x256 images in one shot, the model starts at 4x4 resolution and gradually increases: 4x4 -> 8x8 -> 16x16 -> 32x32 -> 64x64 -> 128x128. Each level trains until stable before the next is introduced.

Det förändrar inlärningsproblemet helt. Vid 4×4 (16 pixlar) behöver modellen bara lära sig grova färgfördelningar. Vid 8×8 grundläggande rumslig layout. Vid 16×16 grova former. Varje upplösningsnivå ärver stabila egenskaper från föregående nivå och behöver bara lära sig den extra detalj som hör till dess skala. Modellen möter aldrig hela 256×256-genereringsproblemet på en gång.This changes the learning problem entirely. At 4x4 (16 pixels), the model only needs to learn rough color distributions. At 8x8, basic spatial layout. At 16x16, coarse shapes. Each resolution level inherits stable features from the previous level and only needs to learn the additional detail at its own scale. The model never faces the full 256x256 generation problem at once.

EXP-023 Progressiv L0–4 (upp till 64×64): Första gången modellen genererade igenkännbara FORMER. Vid nivå 4 (64×64) dök klumpar med definierade kanter och rumslig struktur upp. De hade figur-bakgrundsdelning, något inget tidigare visat. Efter 22 experiment av ingenting annat än brus, texturer och mode-collapse var det att se en centrerad form med definierad gräns ett genombrytande ögonblick.Progressive L0-4 (up to 64x64): The first time the model generated recognizable FORMS. At level 4 (64x64), blobs with defined edges and spatial structure appeared. They had figure-ground separation, which nothing before them had shown. After 22 experiments of nothing but noise, textures, and mode collapse, seeing a centered form with a defined boundary was a breakthrough moment.

EXP-025 Progressiv L5 (128×128): GENOMBROTTET. Efter ~4 timmars träning (50 epoker vid nivå 5, WGAN-GP loss) producerade modellen utdata med sju identifierbara egenskaper:Progressive L5 (128x128): THE breakthrough. After ~4 hours of training (50 epochs at level 5, WGAN-GP loss), the model produced outputs with seven identifiable properties:

  1. Dokumentliknande mönster: textliknande strukturer (inlärda från skärmdumpar och dokument i datasetet)Document-like patterns: text-like structures (learned from the screenshots and documents in the dataset)
  2. Kristallina former: blågrön organisk struktur som liknar glasCrystalline forms: blue-green organic structures resembling glass
  3. Figur-bakgrundsdelning: DET FUNGERAR. Objekt mot bakgrunder.Figure-ground separation: IT WORKS. Objects against backgrounds.
  4. Färgrikedom: Nadjas fulla palett (inte kollapsad till grått)Color richness: Nadja's full palette (not collapsed to gray)
  5. Skärpa: dramatiskt bättre än 64×64Sharpness: dramatically better than 64x64
  6. Kompositionell variation: olika layouter per sampleCompositional variation: different layouts per sample
  7. Organiska former: biologiskt/naturliknande strukturerOrganic forms: biological/natural-looking structures
"DETTA AR SKULPTURER enligt Nadjas definition!"
-- EXP-025-progressive-L5.md, 15 februari 2026-- EXP-025-progressive-L5.md, February 15, 2026

Progressiv GAN använder ungefär 4,5 miljoner parametrar (kontra 30 M för StyleGAN2). Det är ~574 parametrar per träningsbild, en 6,6× förbättring av parameter-till-data-förhållandet jämfört med StyleGAN2.The Progressive GAN uses approximately 4.5 million parameters (vs 30M for StyleGAN2). That is ~574 parameters per training image, a 6.6x improvement in the parameter-to-data ratio compared to StyleGAN2.

Träningsmetriker visade sund GAN-dynamik: G-loss förbättrades från 49,6 till 40,6 (18 % minskning), D-loss stabiliserades vid -5,9 (WGAN-GP målintervall). Ingen mode-collapse. Ingen diskriminatordominans.Training metrics showed healthy GAN dynamics: G-loss improved from 49.6 to 40.6 (18% reduction), D-loss stabilized at -5.9 (WGAN-GP target range). No mode collapse. No discriminator dominance.

EXP-026 Progressiv L6 (256×256): Försökte skala bortom 128×128. Resultat: NaN-losses krävde lagfrysning för att stabiliseras. Utdatan vid 256×256 var "abstrakta klumpar" — den extra upplösningen tillförde ingen meningsfull struktur. Högre upplösning kräver mer data eller mer målinriktad konditionering. Slutsatsen: 128×128 är upplösningstaket för det här datasetet med ovillkorlig generering.Progressive L6 (256x256): Attempted to scale beyond 128x128. Result: NaN losses required layer freezing to stabilize. The output at 256x256 was "abstract blobs" -- the additional resolution did not add meaningful structure. Higher resolution requires more data or more targeted conditioning. The conclusion: 128x128 is the resolution ceiling for this dataset with unconditional generation.

PROGRESSIVE GROWING ARCHITECTURE Level 0: z (512) --> [Dense 4x4x512] --> 4x4 (16 pixels, ~3 min) Level 1: ... --> [UpConv + Conv] --> 8x8 (64 pixels, ~3 min) Level 2: ... --> [UpConv + Conv] --> 16x16 (256 pixels, ~3 min) Level 3: ... --> [UpConv + Conv] --> 32x32 (1,024 pixels, ~5 min) Level 4: ... --> [UpConv + Conv] --> 64x64 (4,096 pixels, ~20 min) ^--- first forms appear here Level 5: ... --> [UpConv + Conv] --> 128x128 (16,384 pixels, ~4 hours) ^--- BREAKTHROUGH: sculpture-like output Loss: WGAN-GP (Wasserstein + gradient penalty) Parameters: ~4,500,000 (6.6x less than StyleGAN2) Params/image: ~574 (vs 3,800 for StyleGAN2) KEY: Each level trains to stability BEFORE the next is added. The model never faces the full generation problem at once.
Progressiv tillväxt lyckas för att den förvandlar ett olösligt problem (generera 128×128 från brus) till en sekvens av hanterbara delproblem (generera 4×4, lägg sedan till detalj mot 8×8, sedan mot 16×16...). Det är strukturellt analogt med biologisk synsutveckling och med hur mänskliga konstnärer bygger bilder: grov komposition först, sedan förfining. Curriculumet ÄR arkitekturen.Progressive growing succeeds because it transforms an intractable problem (generate 128x128 from noise) into a sequence of tractable sub-problems (generate 4x4, then add detail to 8x8, then to 16x16...). This is structurally analogous to biological vision development and to how human artists build images: rough composition first, then refinement. The curriculum IS the architecture.
Fas IV: konditionell GAN / AC-GAN (EXP-027 till EXP-035)Phase IV: Conditional GAN / AC-GAN (EXP-027 to EXP-035) MISSLYCKADESFAILED

Period: 18–22 februari 2026 | Längd: ~35 timmar | Experiment: 9Period: February 18-22, 2026 | Duration: ~35 hours | Experiments: 9

Med progressiv GAN som producerade former kom nästa fråga: kan vi styra utdatan? Kan vi be om "glas" eller "skulptur" specifikt?With progressive GAN producing forms, the next question: can we steer the output? Can we ask for "glass" or "sculpture" specifically?

Två huvudsakliga ansatser testades: klass-konditionell GAN (lägg till kategorietiketter i både generator och diskriminator) och AC-GAN (Auxiliary Classifier GAN, där diskriminatorn också klassificerar bilder efter materialkategori).Two main approaches were tried: class-conditional GAN (add category labels to both generator and discriminator) and AC-GAN (Auxiliary Classifier GAN, where the discriminator also classifies images by material category).

EXP-027-030 Konditionell GAN (4 varianter): Lade till materialkategorietiketter som konditioneringsinsignal. Modellen fick både en brusvektor och en klassembedding. Resultat: kategorier smälter ihop. Med bara 67–523 bilder per materialklass finns otillräckliga exempel för att definiera tydliga klassgränser. Generatorn producerar kompromisser mellan klasser och blandar glasliknande transparens med keramikliknande opacitet till formlösa mellanlägen.Conditional GAN (4 variants): Added material category labels as conditioning input. The model received both a noise vector and a class embedding. Result: categories melt together. With only 67-523 images per material class, there are insufficient examples to define clear class boundaries. The generator produces compromises between classes, blending glass-like transparency with ceramic-like opacity into formless intermediate states.

EXP-031 Konditionell från grunden: Förenklades till binär konditionering (is_sculpture: 0/1). Delvis framgång — modellen svarar på konditioneringssignalen, men det binära etiketten är för grovt för att producera meningsfullt olika utdata.Conditional from scratch: Simplified to binary conditioning (is_sculpture: 0/1). Partial success -- the model responds to the conditioning signal, but the binary label is too coarse to produce meaningfully different outputs.

EXP-032-035 AC-GAN (4 varianter): Diskriminatorn har en dubbeluppgift: (1) klassificera verklig kontra falsk och (2) klassificera materialkategori. Det ger en klassifikationsgradient till generatorn. Resultat: diskriminatordominans. Diskriminatorn lär sig klassificera perfekt (både verklig/falsk och kategori) men klassificeringshuvudet skapar motstridiga gradienter för generatorn. Generatorn kan inte simultaneously maximera realism OCH matcha specifika materialkategorier med så få exempel per klass.AC-GAN (4 variants): The discriminator has a dual task: (1) classify real vs fake, and (2) classify material category. This provides a classification gradient to the generator. Result: discriminator dominance. The discriminator learns to classify perfectly (both real/fake and category) but the classification head creates conflicting gradients for the generator. The generator cannot simultaneously maximize realism AND match specific material categories with so few examples per class.

En 32-dimensionell featurevektor (färgstatistik, kantdensitet, symmetri, texturmått) testades också som konditioneringssignal. Maximalt uppmätt effekt på utdata: 0,45 på en 0–1-skala. Inte tillräckligt för att styra genereringen meningsfullt. Featurena fångar inte glassemantik.A 32-dimensional feature vector (color statistics, edge density, symmetry, texture measures) was also tested as a conditioning signal. Maximum measured effect on output: 0.45 on a 0-1 scale. Not enough to steer the generation meaningfully. The features do not capture glass-semantics.

Konditionell generering på små dataset är kontraproduktivt. Med 67–523 bilder per klass har modellen otillräckliga exempel för att lära sig klassspecifika egenskaper. Diskriminatorn memorerar per-klass-statistiken och dominerar träningen. Generatorn producerar interklassk kompromisser som misslyckas med båda losses på en gång.Conditional generation on small datasets is counterproductive. With 67-523 images per class, the model has insufficient examples to learn class-specific features. The discriminator memorizes the per-class statistics and dominates training. The generator produces inter-class compromises that fail both losses at once.
Konditionering kräver tillräckligt med exempel per kondition för att definiera tydliga beslutsgränser. En binär signal (skulptur / inte-skulptur) är bättre än finkornade flerklassetiketter på ett litet dataset. Komplexa 32-dimensionella features är sämre än enkla binära etiketter för att de introducerar 32 svagt korrelerade brusdimensioner i konditioneringssignalen.Conditioning requires enough examples per condition to define clear decision boundaries. A binary signal (sculpture / not-sculpture) is better than fine-grained multi-class labels on a small dataset. Complex 32-dimensional features are worse than simple binary labels because they introduce 32 weakly-correlated dimensions of noise into the conditioning signal.
Fas V: VQ-VAE (EXP-036 till EXP-038)Phase V: VQ-VAE (EXP-036 to EXP-038) FRAMGÅNGSUCCESS

Period: 22–24 februari 2026 | Längd: ~10 timmar | Experiment: 3Period: February 22-24, 2026 | Duration: ~10 hours | Experiments: 3

En strategisk pivotering: istället för att försöka generera bilder direkt, lär sig först ett diskret visuellt tokenvokabulär. En Vector Quantized Variational Autoencoder (VQ-VAE) komprimerar bilder till ett rutnät av diskreta koder från en inlärd kodbok. Det separerar representationsproblemet (hur bilder kodas) från genereringsproblemet (hur nya produceras).A strategic pivot: instead of trying to generate images directly, first learn a discrete vocabulary of visual tokens. A Vector Quantized Variational Autoencoder (VQ-VAE) compresses images into a grid of discrete codes from a learned codebook. This separates the representation problem (how to encode images) from the generation problem (how to produce new ones).

EXP-036 VQ-VAE 32×32 latent: Indata 128×128, komprimerat till 32×32-rutnät av kodboksindex. 512-posts kodbok, varje post 256-dimensionell. Resultat: fungerar, men förlorar fin detalj (4× rumslig nedsampling).VQ-VAE 32x32 latent: Input 128x128, compressed to 32x32 grid of codebook indices. 512-entry codebook, each entry 256-dimensional. Result: works, but loses fine detail (4x spatial downsampling).

EXP-037 VQ-VAE 64×64 latent: Samma arkitektur men bara 2× nedsampling. 4 096 tokens per bild. Bättre rekonstruktion, bevarar mer detalj.VQ-VAE 64x64 latent: Same architecture but 2x downsampling only. 4,096 tokens per image. Better reconstruction, preserves more detail.

EXP-038 Fullt dataset + augmentering: Tränad på alla 7 843 bilder med RandomCrop, Flip, ColorJitter och Rotation. 1 000 epoker. Resultat: en rikare, mer varierad kodbok. Bättre "visuellt vokabulär".Full dataset + augmentation: Trained on all 7,843 images with RandomCrop, Flip, ColorJitter, and Rotation. 1,000 epochs. Result: a richer, more diverse codebook. Better "visual vocabulary."

Över två stora träningskörningar (vqvae och vqvae_v2) ackumulerade modellen 348 checkpoints och konvergerade till en total loss på 0,0009:Across two major training runs (vqvae and vqvae_v2), the model accumulated 348 checkpoints and converged to a total loss of 0.0009:

  • Rekonstruktionsloss: 0,0007 (nästan pixelperfekt rekonstruktion)Reconstruction loss: 0.0007 (near-pixel-perfect reconstruction)
  • VQ commitment loss: 0,0002 (kodboken används effektivt)VQ commitment loss: 0.0002 (codebook is being used efficiently)

VQ-VAE producerar nästan perfekta rekonstruktioner. Översta raden är original, understa raden är den komprimerade och sedan dekomprimerade bilden. Modellen lärde sig framgångsrikt ett visuellt vokabulär för Nadjas bilder.The VQ-VAE produces near-perfect reconstructions. Top row is original, bottom row is the compressed-then-decompressed image. The model successfully learned a visual vocabulary for Nadja's images.

VQ-VAE ARCHITECTURE ENCODE: Image (256x256x3) --> Encoder CNN --> Continuous features (64x64x256) QUANTIZE: Continuous --> Find nearest codebook entry --> Discrete tokens (64x64 grid) DECODE: Discrete tokens --> Lookup embeddings --> Decoder CNN --> Reconstructed image Codebook: 512 entries, each 256-dimensional Compression: 196,608 continuous values --> 4,096 discrete token IDs (48x reduction) Training loss = reconstruction_loss + beta * commitment_loss Final: 0.0007 + 0.0002 = 0.0009 KEY: No adversarial training. No mode collapse. Stable convergence. The encoder/decoder are DETERMINISTIC once trained. Generation is deferred to a separate model (Phase VI).
VQ-VAE lyckas för att den separerar representationsinlärning från generering. Encoder/decoder lär sig en dubbelriktad avbildning mellan pixlar och diskreta tokens med bara rekonstruktionsloss (ingen adversarial komponent). Det är ett välformulerat optimeringsproblem med ett tydligt globalt minimum. Genereringsproblemet skjuts upp: när man väl har en bra tokenizer behöver man "bara" modellera tokenfördelningar. Som fas VI visade döljer det "bara" en ny uppsättning problem.VQ-VAE succeeds because it decomposes representation learning from generation. The encoder/decoder learn a bidirectional mapping between pixels and discrete tokens using only reconstruction loss (no adversarial component). This is a well-posed optimization problem with a clear global minimum. The generation problem is deferred: once you have a good tokenizer, you "only" need to model token distributions. Unfortunately, as Phase VI showed, this "only" hides a new set of problems.
Fas VI: Token Transformer / MaskGIT (EXP-039 till EXP-044)Phase VI: Token Transformer / MaskGIT (EXP-039 to EXP-044) MISSLYCKADES (~80 TIMMAR)FAILED (~80 HOURS)

Period: 6–24 mars 2026 | Längd: ~80 timmar | Experiment: 6Period: March 6-24, 2026 | Duration: ~80 hours | Experiments: 6

Med en fungerande VQ-VAE-tokenizer (fas V) var planen elegant: träna en transformer att generera tokenföljder, avkoda dem sedan tillbaka till bilder med VQ-VAE-dekodern. Det är arkitekturen bakom DALL-E 1, Parti och MaskGIT. Tvåstegssättet (tokenisera, sedan modellera tokens) är det dominerande paradigmet i modern bildgenerering.With a working VQ-VAE tokenizer (Phase V), the plan was elegant: train a transformer to generate token sequences, then decode them back to images with the VQ-VAE decoder. This is the architecture behind DALL-E 1, Parti, and MaskGIT. The two-stage approach (tokenize, then model tokens) is the dominant paradigm in modern image generation.

Token Transformer (EXP-039, EXP-040)

EXP-039 Token Transformer V1: En autoregressiv transformer (98 tränade checkpoints) som förutsäger nästa token i en rastersekvens (vänster till höger, uppifrån ner). Etablerade en stabil baslinje. Modellen lärde sig tokenstatistik, men genererade bilder visade rasterbias: horisontella randmönster från vänster-till-höger genereringsordningen. Varje rad börjar oberoende.Token Transformer V1: An autoregressive transformer (98 checkpoints trained) that predicts the next token in a raster-scan sequence (left-to-right, top-to-bottom). Established a stable baseline. The model learned token statistics, but generated images showed raster bias: horizontal stripe patterns from the left-to-right generation order. Every row starts independently.

EXP-040 Token Transformer V2: Försökte åtgärda rasterbiasEN med 2D positionskodning och modifierad attention. Biasen kvarstod, nu uttryckt som ett rutmönster. Det fundamentala problemet: autoregressiv generering påtvingar en ordning som bilder inte har. Pixlar (och tokens) har rumsliga relationer, inte sekventiella.Token Transformer V2: Attempted to fix raster bias with 2D positional encoding and modified attention. The bias remained, now expressed as a grid pattern. The fundamental issue: autoregressive generation imposes an ordering that images do not have. Pixels (and tokens) have spatial relationships, not sequential ones.

MaskGIT (EXP-041 to EXP-044)

MaskGIT löser ordningsproblemet genom att generera alla tokens simultant: maskera slumpmässiga tokens, förutsäg dem alla på en gång (som BERT för bilder), behåll de mest säkra förutsägelserna, maskera om resten och iterera. Ingen rasterscan, ingen ordningsbias.MaskGIT solves the ordering problem by generating all tokens simultaneously: mask random tokens, predict them all at once (like BERT for images), keep the most confident predictions, re-mask the rest, and iterate. No raster scan, no ordering bias.

Fyra MaskGIT-varianter testades under ~40 timmar:Four MaskGIT variants were tested over ~40 hours:

IDVariantVariantTokensTokensLossLossResultatResult
EXP-041Standard MaskGIT (3.7M params)5123.4Spridda vita prickar på vittScattered white dots on white
EXP-042MaskGIT 128x1285123.4Samma prickar. Men inpainting fungerar!Same dots. But inpainting works!
EXP-043CTF (Clustered Token Flow, 32 clusters)320.85Mode-collapse till grå blockMode collapse to gray blocks
EXP-044CTF balanced sampling321.06Ljusa/mörka randmönsterLight/dark stripe patterns

RotorsaksanalysRoot cause analysis

En grundlig post-mortem (ANALYS_MASKGIT.md, 24 mars 2026) identifierade fyra rotorsaker:A comprehensive post-mortem (ANALYS_MASKGIT.md, March 24, 2026) identified four root causes:

  1. Katastrofalt obalanserad tokenfördelning: VQ-VAE-kodboken har 512 poster, men bara 4 poster svarar för 76,5 % av alla tokens. Dessa 4 koder representerar bakgrund/tomrum/neutrala toner. När transformern förutsäger "vilket token hör hemma här?" är det statistiskt korrekta svaret nästan alltid en av dessa 4 bakgrundskoder. Ovillkorlig generering fyller därför hela rutnätet med bakgrund.Catastrophically imbalanced token distribution: The VQ-VAE codebook has 512 entries, but just 4 entries account for 76.5% of all tokens. These 4 codes represent background/empty space/neutral tones. When the transformer predicts "what token goes here?", the statistically correct answer is almost always one of these 4 background codes. Unconditional generation therefore fills the entire grid with background.
  2. För många tokens (16 384 per bild): Vid 128×128 med kodboksstorlek 512 blir varje bild ett 128×128-rutnät. Window attention (nödvändig för minnet) kan inte se global kontext. Global attention skulle kräva 268 M attention-poster — OOM på 6 GB VRAM.Too many tokens (16,384 per image): At 128x128 with codebook size 512, each image becomes a 128x128 grid. Window attention (required for memory) cannot see global context. Global attention would require 268M attention entries -- OOM on 6 GB VRAM.
  3. För lite data (6 806 bilder): Med 6 806 heterogena bilder har transformern otillräckliga exempel för att lära sig meningsfulla rumsliga token-samlingsförekomstmönster.Too little data (6,806 images): With 6,806 heterogeneous images, the transformer has insufficient examples to learn meaningful spatial token co-occurrence patterns.
  4. Ovillkorlig generering är matematiskt underbestämd: Utan någon konditioneringssignal (textprompt, klassetikett, delvis bild) måste modellen generera "en trovärdig bild" från ingenting. Med heterogen data är den mest trovärdiga utdatan den vanligaste utdatan: bakgrund.Unconditional generation is mathematically underdetermined: Without any conditioning signal (text prompt, class label, partial image), the model must generate "a plausible image" from nothing. With heterogeneous data, the most plausible output is the most common output: background.

Kritiskt fynd: I EXP-042 fungerade MaskGIT-inpainting. När den fick en riktig bild med vissa tokens maskerade fyllde modellen i de maskerade regionerna koherent. Det bevisar att modellen lärde sig meningsfulla tokenrelationer. Men utan initial kontext (ovillkorlig) faller den tillbaka på majoritetsklassen.Critical discovery: In EXP-042, MaskGIT inpainting worked. When given a real image with some tokens masked, the model filled in the masked regions coherently. This proves the model learned meaningful token relationships. But without any initial context (unconditional), it defaults to the majority class.

MASKGIT TOKEN DISTRIBUTION PROBLEM Codebook usage across 6,806 training images: Token ID Usage 47 ████████████████████████████ 22.1% \ 198 ██████████████████████ 18.3% | 76.5% of ALL tokens 12 ██████████████████ 16.8% | = 4 background codes 304 █████████████████ 15.3% / ... ▏ 0.1% -- 500+ rare codes ... ▏ 0.05% When the model asks "what is the most likely token here?" The answer is ALWAYS one of these 4 codes. Unconditional generation = fill everything with background.
"Avsluta MaskGIT-sparet. Atervand till Progressive GAN."
-- ANALYS_MASKGIT.md, March 24, 2026, after 40 hours of MaskGIT experiments
"Efter 41 experiment och 333 timmar: Arkitektur loser INTE dataproblem. 7,000 heterogena bilder + from scratch + unconditional = matematiskt underbestamt."
-- EXP-041, the central insight of the entire project
Tokenbaserad generering kräver balanserade tokenfördelningar. När 4 av 512 kodboksposter dominerar 76,5 % av alla tokens är transformerns maximum-likelihood-förutsägelse alltid bakgrund. En fungerande encoder garanterar inte en fungerande generator. Inpainting fungerar (kontext ger signal) men ovillkorlig generering misslyckas (ingen signal att starta från).Token-based generation requires balanced token distributions. When 4 of 512 codebook entries dominate 76.5% of all tokens, the transformer's maximum-likelihood prediction is always background. A working encoder does not guarantee a working generator. Inpainting works (context provides signal) but unconditional generation fails (no signal to bootstrap from).
Tvåstegssättet (tokenisera sedan modellera) fungerar på internetskala (DALL-E: 250 M bilder, Parti: 1 miljard bilder) där tokenfördelningar är varierande och ungefär balanserade. I skalan 7 000 heterogena bilder med en obalanserad kodbok är tokenfördelningen för skev för att en transformer ska lära sig meningsfull ovillkorlig generering. Kodboken måste balanseras om, eller så måste genereringen konditioneras.The two-stage paradigm (tokenize then model) works at internet scale (DALL-E: 250M images, Parti: 1B images) where token distributions are diverse and roughly balanced. At the scale of 7,000 heterogeneous images with an unbalanced codebook, the token distribution is too skewed for a transformer to learn meaningful unconditional generation. The codebook must be rebalanced, or generation must be conditioned.
Fas VII: återgång till progressiv GAN (EXP-045 till EXP-046)Phase VII: Return to Progressive GAN (EXP-045 to EXP-046) BEKRÄFTAT BÄSTCONFIRMED BEST

Period: 24–25 mars 2026 | Längd: ~5 timmar | Experiment: 2Period: March 24-25, 2026 | Duration: ~5 hours | Experiments: 2

Efter MaskGIT-misslyckandets analys, en medveten återgång till den arkitektur som faktiskt fungerade. Frågan: var fas III-resultaten reproducerbara, eller var de en lycklig tillfällighet i en stokastisk process?After the MaskGIT failure analysis, a deliberate return to the architecture that actually worked. The question: were the Phase III results reproducible, or a lucky fluke from a stochastic process?

EXP-045 Progressiv GAN (återgång): Körde om den progressiva GAN-pipelinen från grunden. På ungefär 10 minuter bekräftade modellen: progressiv tillväxt producerar fortfarande de bästa resultaten av alla testade arkitekturer. Resultatet var ingen slump. Arkitekturen genererar tillförlitligt strukturerade former på det här datasetet.Progressive GAN (return): Re-ran the progressive GAN pipeline from scratch. In approximately 10 minutes, the model confirmed: progressive growing still produces the best results of any architecture tested. The result was not a fluke. The architecture reliably generates structured forms on this dataset.

EXP-046 Progressiv L5 fortsättning: Fortsatte träning från nivå 5-checkpointet (epoch 50) till epoch 100. Träning pågick från 22:10 den 24 mars till 02:43 den 25 mars (4,5 timmar). GPU-temperaturen nådde som mest 71°C. VRAM låg mellan 1,6–2,5 GB. Noll krascher.Progressive L5 continuation: Continued training from the Level 5 checkpoint (epoch 50) through epoch 100. Training ran from 22:10 on March 24 to 02:43 on March 25 (4.5 hours). GPU temperature peaked at 71C. VRAM stayed between 1.6-2.5 GB. Zero crashes.

Diskriminatorlossen stabiliserades kring -10 från epoch 65 och framåt, vilket indikerar att det adversariala spelet nått jämvikt. De 50 extra epokerna producerade synliga förbättringar:The discriminator loss stabilized around -10 from epoch 65 onward, indicating the adversarial game had reached equilibrium. The 50 additional epochs produced visible improvements:

  • Mer definierade objektgränser och konturerMore defined object boundaries and contours
  • Rikare ytatexturer (metalliska, organiska, glasliknande)Richer surface textures (metallic, organic, glass-like)
  • Bättre figur-bakgrundsdelning med mörkare/neutrala bakgrunderBetter figure-ground separation with darker/neutral backgrounds
  • Större kompositionell mångfald över samplesGreater compositional diversity across samples
  • Vissa bilder innehåller igenkännbara skulpturala element: kärl, gjutna former, sammansatta objektSome images contain recognizable sculptural elements: vessels, cast forms, assembled objects

Avtagande avkastning var tydlig från epoch 65. Grundproblemet (heterogent dataset, ovillkorlig generering) kan inte lösas med mer träning. Modellen har lärt sig vad den kan lära sig från den här datan vid den här upplösningen.However, diminishing returns were clear from epoch 65. The root problem (heterogeneous dataset, unconditional generation) cannot be solved with more training. The model has learned what it can learn from this data at this resolution.

Den progressiva GAN är inte bara den bäst testade arkitekturen. Den är den enda arkitektur som producerar utdata som matchar den strukturella definitionen av skulptur: centrerade former med definierade kanter och figur-bakgrundsdelning. Det beror på att progressiv tillväxt är den enda ansatsen som bryter ner genereringsproblemet till ett inlärbart curriculum i den här dataskalan. Curriculumet ÄR lösningen.The progressive GAN is not merely the best architecture tested. It is the only architecture that produces outputs matching the structural definition of sculpture: centered forms with defined edges and figure-ground separation. This is because progressive growing is the only approach that decomposes the generation problem into a learnable curriculum at this data scale. The curriculum IS the solution.
Fas VIII: parallella utforskningarPhase VIII: Parallel Explorations BLANDADE RESULTATMIXED RESULTS

Under hela projektet utforskade flera sidoexperiment alternativa ansatser. De stod utanför huvudspåret och gav extra insikter, i vissa fall de visuellt mest övertygande utdatan i hela projektet.Throughout the project, several side experiments explored alternative approaches. These sat outside the main trajectory and gave extra insight, in some cases the most visually compelling outputs of the whole project.

Lättvikts-/turbo-varianterLightweight / Turbo variants

Snabboptimerade progressiva GAN med aggressivt reducerade parameterantal. "Turbo"-varianten producerade några av de mest slående utdatan: biomorfiska, organiska former med glasliknande translucens, tydlig figur-bakgrundsdelning mot neutrala grå bakgrunder och skulptural närvaro. Dessa former liknar biologiska specimen, gjutna glasobjekt och sammansatta skulpturer. Det reducerade parameterantalet kan ha fungerat som regularisering och hindrat modellen från att memorera datasetspecifika texturer och istället lära sig strukturella primitiver.Speed-optimized progressive GANs with aggressively reduced parameter counts. The "turbo" variant produced some of the most striking outputs: biomorphic, organic forms with glass-like translucency, clear figure-ground separation on neutral gray backgrounds, and sculptural presence. These forms resemble biological specimens, cast glass objects, and assembled sculptures. The reduced parameter count may have acted as regularization, preventing the model from memorizing dataset-specific textures and instead learning structural primitives.

PixelGPT

Autoregressiv pixel-för-pixel-generering vid 64×64. Modellen förutsäger varje pixelvärde konditionerat på alla föregående pixlar (i rasterordning). Resultat: lär sig färgfördelningar men inte rumslig struktur. Varje rad börjar ett nytt färgfält och skapar horisontella randmönster. En färgpalettanalys visade att modellen lärde sig Nadjas färgvokabulär (bärnstensgult, blågrönt, grått, svart, vitt) utan att lära sig hur det arrangeras rumsligt.Autoregressive pixel-by-pixel generation at 64x64. The model predicts each pixel value conditioned on all previous pixels (in raster order). Result: learns color distributions but not spatial structure. Each row begins a new color field, creating horizontal stripe patterns. A color palette analysis showed the model learned Nadja's color vocabulary (amber, teal, gray, black, white) without learning how to arrange it spatially.

Strukturerad autoencoderStructured Autoencoder

Autoencoder med strukturella begränsningar (kantkonsistens, konturbevarelse). Producerar mjuka interpolationer mellan träningsbilder i det latenta rummet. Användbart för att förstå den latenta manifolden men inte för ny generering. Interpolationerna genomkorsar ett kontinuerligt rum av träningsbildsliknande texturer.Autoencoder with structural constraints (edge consistency, contour preservation). Produces smooth interpolations between training images in latent space. Useful for understanding the latent manifold but not for novel generation. The interpolations traverse a continuous space of training-image-like textures.

Flow Matching

Ett modernt alternativ till diffusion som lär sig direkta deterministiska banor från brus till data (istället för stokastisk diffusion/avbrusning). Vid epoch 20 producerar den spöklika, halvtransparenta kompositioner med skiktat rumslig struktur. Utdatan har en eterisk kvalitet som skiljer sig från alla andra arkitekturer. Undertränad (bara 20 epoker) men lovande för framtida utforskning.A modern alternative to diffusion that learns direct deterministic trajectories from noise to data (instead of stochastic diffusion/denoising). At epoch 20, produces ghostly, semi-transparent compositions with layered spatial structure. The outputs have an ethereal quality distinct from any other architecture. Undertrained (only 20 epochs) but promising for future exploration.

Progressiv isolerad / kureradProgressive Isolated / Curated

Progressiv GAN tränad på kurerade delmängder: isolerade objekt (4 133 bilder) och strikt kurerade skulpturer (300–917 bilder). Det isolerade datasetet producerade renare figur-bakgrundsdelning. De kurerade dataseten producerade mer koherenta objekt men med minskad mångfald. Datasetkuration styr direkt avvägningen mellan mångfald och strukturell koherens.Progressive GAN trained on curated subsets: isolated objects (4,133 images) and strictly curated sculptures (300-917 images). The isolated dataset produced cleaner figure-ground separation. The curated datasets produced more coherent objects but with reduced diversity. Dataset curation directly controls the trade-off between diversity and structural coherence.

Ibland kommer de visuellt mest intressanta utdatan från arkitekturer som inte var de "bästa" enligt något mått. Lightweight Turbo-modellen, med färre parametrar och snabbare träning, producerade utdata med mer skulptural närvaro än de större modellerna. Begränsningar (färre parametrar, mindre kapacitet) kan tvinga en modell att lära sig strukturella primitiver istället för att memorera ytatexturer.Sometimes the most visually interesting outputs come from architectures that were not the "best" by any metric. The Lightweight Turbo model, with fewer parameters and faster training, produced outputs with more sculptural presence than the larger models. Constraints (fewer parameters, less capacity) can force a model to learn structural primitives instead of memorizing surface textures.
De sju besluten: principer som styrde 400 timmars forskningThe Seven Decisions: principles that guided 400 hours of research

Under hela projektet dokumenterades sju formella beslut. Varje beslut skrevs som svar på en specifik kris eller insikt och förblev aktivt för resten av projektet. Tillsammans definierar de det filosofiska ramverket inom vilket alla experiment genomfördes.Throughout the project, seven formal decisions were documented. Each was written as a response to a specific crisis or insight, and each remained active for the remainder of the project. Together they define the philosophical framework within which all experiments operated.

DEC-001 | February 15, 2026 | ACTIVE
Ingen förtränad bias. Allt från grunden.No pretrained bias. Everything from scratch.
Förbjudet: finjustering av Stable Diffusion. LoRA/DreamBooth. Förtränade encoders (CLIP, DINO, Inception). Transfer learning från ImageNet. Alla modeller tränade på externa dataset. Till och med FID-utvärdering (kräver förtränad Inception) avvisades. Modellen måste lära sig uteslutande från Nadjas 7 843 bilder. Den begränsningen ökar svårigheten enormt men säkerställer att varje genererad textur, färg och form kommer från konstnärens egna visuella värld.Forbidden: Fine-tuning Stable Diffusion. LoRA/DreamBooth. Pretrained encoders (CLIP, DINO, Inception). Transfer learning from ImageNet. Any model trained on external datasets. Even FID evaluation (requires pretrained Inception) was rejected. The model must learn exclusively from Nadja's 7,843 images. This constraint increases difficulty enormously but ensures that every generated texture, color, and form comes from the artist's own visual world.
DEC-002 | February 15, 2026 | ACTIVE | NON-NEGOTIABLE
Acceptera aldrig "stämningsgenerator" som svar.Never accept "mood generator" as an answer.
Den mest absoluta regeln. Formaliserades efter räddningssessionen (7 februari) där den ärliga bedömningen var att modellen producerar texturer, inte skulpturer. Beslutet: det spelar ingen roll hur många experiment som misslyckas. Det spelar ingen roll hur "omöjligt" det verkar. Fortsätt forskning tills det fungerar. Förbjudna förslag: "Acceptera begränsningen", "Använd som texturegenerator", "Sänk förväntningarna", "Det är omöjligt." Det här beslutet testades upprepade gånger (efter 17 GAN-misslyckanden, efter 4 MaskGIT-misslyckanden) och höll varje gång.The most absolute rule. Formalized after the rescue session (February 7) where the honest assessment was that the model produces textures, not sculptures. The decision: it does not matter how many experiments fail. It does not matter how "impossible" it seems. Continue research until it works. Forbidden suggestions: "Accept the limitation", "Use as texture generator", "Lower expectations", "It's impossible." This decision was tested repeatedly (after 17 GAN failures, after 4 MaskGIT failures) and held each time.
DEC-003 | February 22, 2026 | ACTIVE
Upprepa aldrig ett experiment.Never repeat an experiment.
Innan varje nytt experiment: läs hela experimentindex, verifiera att ansatsen inte testats, identifiera vad som är fundamentalt nytt. "Samma arkitektur med lägre learning rate" (redan testad 5+ gånger) är inte acceptabelt. "Samma arkitektur med fler epoker" ger inga nya insikter. Tid är den mest värdefulla resursen. Varje experiment måste testa en genuint ny hypotes.Before any new experiment: read the full experiment index, verify the approach has not been tried, and identify what is fundamentally new. "Same architecture with lower learning rate" (already tested 5+ times) is not acceptable. "Same architecture with more epochs" provides no new insights. Time is the most valuable resource. Every experiment must test a genuinely novel hypothesis.
DEC-004 | February 22, 2026 | ACTIVE (superseded in practice by EXP-045)
Token Transformer är huvudforskningsspåret.Token Transformer is the main research track.
Efter att ha testat Simple AE, VAE, GAN och Diffusion identifierades Token Transformer som den mest lovande riktningen: Tokenizer (VQ-VAE) → Transformer (förutsäg tokens) → Detokenizer (VQ-VAE-decoder). Det här beslutet upprätthölls formellt men i praktiken ersattes det efter MaskGIT-misslyckandena (fas VI) som ledde till återgången till progressiv GAN (fas VII).After testing Simple AE, VAE, GAN, and Diffusion, the Token Transformer was identified as the most promising direction: Tokenizer (VQ-VAE) -> Transformer (predict tokens) -> Detokenizer (VQ-VAE decoder). This decision was formally maintained but in practice superseded after the MaskGIT failures (Phase VI) led to the return to Progressive GAN (Phase VII).
DEC-005 | March 6, 2026 | ACTIVE
Tvåfas-träningsstrategi.Two-phase training strategy.
Fas 1 (epoker 0–50): Fryst encoder, bara dekodern tränas, lägre learning rate, fokus på rekonstruktionskvalitet. Fas 2 (epoker 50+): Ufryst encoder, båda tränas simultant, gradvis ökande komplexitet, fokus på generering. Det förhindrar att encodern destabiliseras av tidiga brusiga generatorutdata.Phase 1 (epochs 0-50): Frozen encoder, only decoder trains, lower learning rate, focus on reconstruction quality. Phase 2 (epochs 50+): Unfrozen encoder, both train simultaneously, gradually increasing complexity, focus on generation. This prevents the encoder from being destabilized by early noisy generator outputs.
DEC-006 | March 15, 2026 | ACTIVE | CRITICAL REDEFINITION
Skulptur definieras strukturellt, inte semantiskt.Sculpture is defined structurally, not semantically.
Den tidigare ansatsen försökte klassificera material (glas, metall, keramik) — en semantisk definition. Nadjas egna definition är strukturell: en skulptur är (1) ett centrerat objekt, (2) med definierade kanter, (3) med figur-bakgrundsdelning. Den omdefineringen innebar att EXP-025 (progressiv GAN L5) retroaktivt erkändes som en FRAMGÅNG: den producerar centrerade former med kanter och figur-bakgrundsdelning, oberoende av materialklassificering. Datasetkuration bör fokusera på struktur (centrerade objekt), inte semantik (materialtyp).The previous approach tried to classify materials (glass, metal, ceramic) -- a semantic definition. Nadja's own definition is structural: a sculpture is (1) a centered object, (2) with defined edges, (3) with figure-ground separation. This redefinition meant that EXP-025 (Progressive GAN L5) was retroactively recognized as a SUCCESS: it produces centered forms with edges and figure-ground separation, regardless of material classification. Dataset curation should focus on structure (centered objects), not semantics (material type).
DEC-007 | March 15, 2026 | ACTIVE | THE CENTRAL INSIGHT
Arkitektur löser INTE dataproblem.Architecture does NOT solve data problems.
Efter 41 experiment i alla stora arkitekturfamiljer: 7 000 heterogena bilder + träning från grunden + ovillkorlig generering = matematiskt underbestämt. Att byta arkitektur kan inte fixa det. Receptet: (1) förbättra datasetkvaliteten genom kuration, (2) lägg till strukturell konditionering (figur-bakgrundssignaler), (3) acceptera upplösningsgränser (128×128 fungerar, 256×256 gör det inte med den här datan). Sluta behandla arkitekturbyten som lösningen på dataproblem.After 41 experiments across all major architecture families: 7,000 heterogeneous images + from-scratch training + unconditional generation = mathematically underdetermined. Switching architectures cannot fix this. The prescription: (1) improve dataset quality through curation, (2) add structural conditioning (figure-ground signals), (3) accept resolution limits (128x128 works, 256x256 does not with this data). Stop treating architecture changes as the solution to data problems.
Komplett experimentlogg: 46 experiment, 400 timmarComplete Experiment Log: 46 experiments, 400 hours
IDDatumDateExperimentExperimentArkitekturArchitectureTidTimeStatusStatusNyckelobservationKey finding
001-017Nov '25 - Feb '26StyleGAN2 variantsStyleGAN2~150hMISSLYCKADESFAILEDAll mode-collapse. 30 M params för många.All mode-collapsed. 30M params too many.
0182026-02-06Pixel DiffusionU-Net Diffusion~28hMISSLYCKADESFAILEDMSE medelvärdar till datasettets medelvärdeMSE averages to dataset mean
0192026-02-07CLIP DiffusionCLIP + Diffusion~1hÖVERGIVENABANDONEDBryter mot from-scratch-principenViolates from-scratch principle
0202026-02-08NadjaEMBEDCustom Embed + Diffusion~20hMISSLYCKADESFAILED14 % recall, fortfarande suddigt14% recall, still blurry
0212026-02-08SlotDiffusionSlot Attention + Diffusion~15hMISSLYCKADESFAILEDDesignad för syntetisk dataDesigned for synthetic data
0222026-02-09Edge-FirstEdge GAN + Colorize~16hMISSLYCKADESFAILEDKantkartor för glesa för GANEdge maps too sparse for GAN
0232026-02-14Progressive L0-4Progressive GAN~3hFRAMGÅNGSUCCESSFörsta former vid 64×64!First forms at 64x64!
0242026-02-15Progressive + ADAProgressive + ADA~2hÖVERGIVENABANDONEDADA-augmentering behövdes inteADA augmentation not needed
0252026-02-15Progressive L5Progressive GAN 128x128~4hBÄSTA RESULTATETBEST RESULTGENOMBROTT: skulpturformer!BREAKTHROUGH: sculpture forms!
0262026-02-16Progressive L6Progressive GAN 256x256~6hDELVISPARTIALNaN + abstrakta klumpar. 256×256 för svårt.NaN + abstract blobs. 256x256 too hard.
027-030Feb 18-21Conditional GANcGAN~20hMISSLYCKADESFAILEDKategorier smälter ihopCategories melt together
0312026-02-21Conditional scratchBinary cGAN~5hDELVISPARTIALSvarar på signal men svag effektResponds to signal but weak effect
032-035Feb 21-22AC-GAN variantsAC-GAN~10hMISSLYCKADESFAILEDDiskriminatordominansDiscriminator dominance
036-038Feb 22-24VQ-VAEVQ-VAE~10hFRAMGÅNGSUCCESSLoss 0,0009. Fungerande tokenizer.Loss 0.0009. Working tokenizer.
0392026-03-06Token Transformer V1Autoregressive Transformer~30hFRAMGÅNGSUCCESSStabil baslinje (men rasterbias)Stable baseline (but raster bias)
0402026-03-09Token Transformer V22D Transformer~10hDELVISPARTIALRutmönster (rasterbias kvarstår)Grid patterns (raster bias persists)
041Mar 11-15MaskGITMaskGIT (3.7M)~15hMISSLYCKADESFAILEDSpridda prickar (tokenobalans)Scattered dots (token imbalance)
0422026-03-24MaskGIT 128x128MaskGIT~8hMISSLYCKADESFAILEDInpainting OK, ovillkorlig = prickarInpainting OK, unconditional = dots
0432026-03-24CTF MaskGITMaskGIT + 32 clusters~10hMISSLYCKADESFAILEDMode-collapse till gråttMode collapse to gray
0442026-03-24CTF balancedMaskGIT + balanced~7hDELVISPARTIALLjusa/mörka mönsterLight/dark patterns
0452026-03-24Progressive (return)Progressive GAN~10minBEKRÄFTATCONFIRMEDFortfarande bäst efter 400 timmarStill the best after 400 hours
046Mar 24-25Progressive L5 cont.Progressive GAN~4.5hFRAMGÅNGSUCCESSEpoch 100. Avtagande avkastning från 65.Epoch 100. Diminishing returns from 65.

Testade arkitekturfamiljerArchitecture families tested

ARCHITECTURE FAMILY TREE ADVERSARIAL (GAN-based): +-- StyleGAN2 (17 variants) --> ALL FAILED (mode collapse) +-- Progressive GAN --> BREAKTHROUGH (curriculum learning) +-- Conditional GAN (4 variants) --> FAILED (categories melt) +-- AC-GAN (4 variants) --> FAILED (D dominance) NON-ADVERSARIAL: +-- Pixel Diffusion (U-Net) --> FAILED (MSE = average) +-- Latent Diffusion (VAE + U-Net) --> FAILED (textures only) +-- Edge Diffusion (Sobel + U-Net) --> FAILED (sparse data) +-- SlotDiffusion (Slot Attention + Diff) --> FAILED (synthetic data assumption) +-- Flow Matching --> PROMISING (undertrained) TWO-STAGE (Tokenize + Generate): +-- VQ-VAE encoder/decoder --> SUCCESS (tokenizer works) +-- Token Transformer (autoregressive) --> PARTIAL (raster bias) +-- MaskGIT (masked prediction) --> FAILED (token imbalance) AUTOENCODER (reconstruction-based): +-- Simple AE --> FAILED (blurry) +-- Structured AE --> PARTIAL (interpolation only) +-- VAE v3 (Vaeana) --> SUCCESS (but unused) HYBRID: +-- NadjaEMBED + Diffusion --> FAILED (14% recall) +-- PixelGPT (autoregressive pixels) --> FAILED (no spatial structure) +-- Lightweight / Turbo variants --> PARTIAL (visually striking)
46 experiment | ~400 timmar | 7 843 bilder | 1 genombrott46 experiments | ~400 hours | 7,843 images | 1 breakthrough GTX 1660 Super (6 GB) Från grundenFrom scratch