min_bild_ai
med definierade kanter och figur-bakgrundsdelning.""A sculpture is anything centered in the image,
with defined edges and figure-ground separation."
Det är en STRUKTURELL definition, inte en semantisk.This is a STRUCTURAL definition, not a semantic one.
Maskinen måste lära sig form, inte mening.The machine must learn form, not meaning.
Inga förtränade modeller. Inga genvägar. Inga kompromisser.No pretrained models. No shortcuts. No compromises.
Efter 400 timmar och 46 experiment är svaret ingen arkitektur.
Svaret är ett curriculum.After 400 hours and 46 experiments, the answer is not an architecture.
The answer is a curriculum.
| FasPhase | ArkitekturArchitecture | ExperimentExperiments | GPU-tidGPU Time | NyckelresultatKey Result |
|---|---|---|---|---|
| I | StyleGAN2 | 17 | ~150h | All mode-collapse. 30 M params för många för 7 K bilder.All mode-collapsed. 30M params too many for 7K images. |
| II | Diffusion (pixel, latent, edge, slot) | 5 | ~80h | MSE medelvärdar till datasetet. Bara texturer, inga objekt.MSE averages to dataset mean. Only textures, no objects. |
| III | Progressive GAN | 5 | ~15h | GENOMBROTT. Former vid 128x128. Figur-bakgrundsdelning.BREAKTHROUGH. Forms at 128x128. Figure-ground separation. |
| IV | Conditional GAN / AC-GAN | 9 | ~35h | Kategorier smälter ihop. Diskriminatordominans.Categories melt together. Discriminator dominance. |
| V | VQ-VAE | 3 | ~10h | Fungerande tokenizer (loss 0,0009). Nästan perfekt rekonstruktion.Working tokenizer (loss 0.0009). Near-perfect reconstruction. |
| VI | Token Transformer / MaskGIT | 6 | ~80h | Tokenobalans: 4 av 512 koder = 76,5 % av datan. Mode-collapse.Token imbalance: 4 of 512 codes = 76.5% of data. Mode collapse. |
| VII | Progressive GAN (return) | 2 | ~5h | Bekräftat bäst. Fortsatte till epoch 100.Confirmed best. Continued to epoch 100. |
Vad fungeradeWhat worked
- Progressiv tillväxt (grovt-till-fint curriculum)Progressive growing (coarse-to-fine curriculum)
- VQ-VAE encoder/decoder (0,0009 total loss)VQ-VAE encoder/decoder (0.0009 total loss)
- Små modeller (~4,5 M params) på liten dataSmall models (~4.5M params) on small data
- WGAN-GP loss (stabilare än vanilla GAN)WGAN-GP loss (more stable than vanilla GAN)
- Watchdog-skript för kraschåterställningWatchdog scripts for crash recovery
Vad misslyckadesWhat failed
- StyleGAN2 (30 M params = overfitting)StyleGAN2 (30M params = overfitting)
- Pixeldiffusion (MSE medelvärdar allt)Pixel-space diffusion (MSE averages everything)
- Ovillkorlig tokengenerering (underbestämd)Unconditional token generation (underdetermined)
- Multi-klass-konditionering (för få per klass)Multi-class conditioning (too few per class)
- Kant-först-ansats (för gles för GAN)Edge-first approaches (too sparse for GAN)
Principer som hölls hela vägenPrinciples maintained throughout
- INGA förtränade modeller (CLIP, Inception, SD, LoRA)NO pretrained models (CLIP, Inception, SD, LoRA)
- INGEN "stämningsgenerator"-kompromiss accepteradesNO "mood generator" compromises accepted
- INGA upprepade experiment (varje måste vara nytt)NO repeated experiments (each must be novel)
- Allt lärt enbart från konstnärens dataEverything learned from the artist's data alone
HårdvarubegränsningarHardware constraints
- GTX 1660 Super: 6 GB VRAM, ~6.5 TFLOPS
- Max batch-storlek: 12 (större orsakar OOM-frysning)Max batch size: 12 (larger causes OOM freeze)
- GPU-tempgräns: 80°C (watchdog avbryter processen)GPU temp limit: 80C (watchdog kills process)
- 2 systemfrysningar överlevda via checkpoint-återhämtning2 system freezes survived via checkpoint recovery
Hela projektet är byggt på ett enda dataset: 7 843 fotografier hämtade från konstnärens kamerarulle, skalade till 256×256 pixlar. Det är den enda träningsdatan. Inga externa bilder, ingen augmentering från andra källor, ingen syntetisk data.The entire project is built on a single dataset: 7,843 photographs extracted from the artist's camera roll, resized to 256x256 pixels. This is the only training data. No external images, no augmentation from other sources, no synthetic data.
Datasetet är radikalt heterogent. Det innehåller allt en konstnär fotograferar under år av praktik: glaskonstverk i olika stadier, keramiska verk, metallgjutningar, studiomiljöer, galleriinstallationer, utställningsdokumentation, närbild på materialytor, textdokument, skärmdumpar, privata fotografier, natur, gatufynd, referensbilder och vardag.The dataset is radically heterogeneous. It contains everything an artist photographs over years of practice: glass sculptures in various stages of completion, ceramic works, metal castings, studio environments, gallery installations, exhibition documentation, close-ups of material surfaces, text documents, screenshots, personal photographs, nature, objects found on the street, reference images, and everyday life.
Den heterogeniteten är både den avgörande utmaningen och projektets filosofiska kärna. En förtränad modell (Stable Diffusion, DALL-E) för med sig sitt eget visuella ordförråd inlärt från miljarder internetbilder. Att träna från grunden på just den här samlingen betyder att modellen bara kan lära sig från den här specifika visuella världen. Varje textur den genererar, varje färg den väljer, varje form den producerar kommer uteslutande från Nadjas fotografiska praktik.This heterogeneity is both the defining challenge and the philosophical core of the project. A pretrained model (Stable Diffusion, DALL-E) would impose its own visual vocabulary learned from billions of internet images. Training from scratch on this specific collection means the model can only learn from this particular visual world. Every texture it generates, every color it chooses, every form it produces comes exclusively from Nadja's photographic practice.
Datasetvarianter använda i experimentenDataset variants used across experiments
| DatasetvariantenDataset variant | BilderImages | StorlekSize | SyftePurpose |
|---|---|---|---|
| dataset_v15_actual (primary) | 7,843 | 2.0 GB | Fullständig originalextraktion från kamerarullenFull original camera roll extraction |
| dataset_no_gray | 6,806 | 1.9 GB | Gråskale-/svartvita bilder borttagnaRemoved grayscale/B&W images |
| dataset_isolated | 4,133 | 471 MB | Bilder med isolerade objekt mot bakgrunderImages with isolated objects on backgrounds |
| dataset_strict | 1,444 | 176 MB | Striktast kurerade: bara centrerade objektMost strictly curated: centered objects only |
| dataset_curated_v2 | 750 | 390 MB | Handplockade bästa skulpturbilderHand-picked best sculpture images |
| dataset_curated | 917 | 120 MB | Första kureringsvändanFirst curation pass |
| curated_sculptures | 300 | 90 MB | De 300 mest skulpturliknande bildernaTop 300 sculpture-like images |
| dataset_edges | 7,501 | 124 MB | Sobel-kantkartor av alla bilderSobel edge maps of all images |
| dataset_glass_only | 67 | 23 MB | Glasobjekt enbart (för få för träning)Glass objects only (too few for training) |
| dataset_glass_v2 | 116 | 43 MB | Utökat glasset (fortfarande för få)Expanded glass set (still too few) |
FörprocesseringspipelinePreprocessing pipeline
Utöver råbilderna gjordes extensiv feature-extraktion för att stödja konditionerad generering och analys:Beyond the raw images, extensive feature extraction was performed to support conditional generation and analysis:
- Featurevektorer (6,6 GB): 32-dimensionella deskriptorer per bild inklusive färgstatistik, kantdensitet, symmetri och texturmåttFeature vectors (6.6 GB): 32-dimensional descriptors per image including color statistics, edge density, symmetry, and texture measures
- SAM-segmenteringsmasker (35 MB): automatisk objektsegmentering med Segment Anything (applicerat på datan, inte i modellträningen)SAM segmentation masks (35 MB): Automatic object segmentation using Segment Anything (applied to data only, not to model training)
- Kantkartor (124 MB): Sobel-filtrerade versioner för kantmedvetna träningsexperimentEdge maps (124 MB): Sobel-filtered versions for edge-aware training experiments
- VQ-VAE-tokens (246 MB): förberäknade diskreta tokenrepresentationer för transformerexperimentVQ-VAE tokens (246 MB): Pre-computed discrete token representations for transformer experiments
Det fundamentala dataproblemetThe fundamental data problem
Moderna generativa modeller tränas vanligtvis på miljontals bilder (FFHQ: 70 K ansikten, LAION: 5 miljarder bild-textpar, ImageNet: 14 M bilder). Det här projektet använder 7 843 heterogena bilder. Lyckad träning från grunden i den skalan kräver antingen: (a) ett mycket homogent dataset, (b) en väldigt liten modell, eller (c) ett träningscurriculum som bryter ner problemet. Projektet hittade alternativ (c).Modern generative models are typically trained on millions of images (FFHQ: 70K faces, LAION: 5B image-text pairs, ImageNet: 14M images). This project uses 7,843 heterogeneous images. Successful from-scratch training at this scale requires either: (a) a very homogeneous dataset (all similar images), or (b) a very small model, or (c) a training curriculum that decomposes the problem. The project discovered option (c).
Period: november 2025–februari 2026 | Längd: ~150 timmar | Experiment: 17Period: November 2025 - February 2026 | Duration: ~150 hours | Experiments: 17
Projektet började med StyleGAN2, den dominerande GAN-arkitekturen för högkvalitativ bildgenerering. Resonemanget: StyleGAN2 genererar fotorealistiska 1024×1024-ansikten från 70 000 justerade bilder (FFHQ). Det borde klara av att generera 256×256-skulpturer från 7 843 bilder.The project began with StyleGAN2, the dominant GAN architecture for high-quality image generation. The reasoning: StyleGAN2 generates photorealistic 1024x1024 faces from 70,000 aligned images (FFHQ). Surely it can generate 256x256 sculptures from 7,843 images.
Det klarade det inte. Alla 17 varianter drabbades av samma tre problem:It could not. All 17 variants suffered the same three problems:
- Mode-collapse: Generatorn konvergerar mot att producera samma bild upprepade gånger, eller ett litet kluster av nästan identiska utdata. Diskriminatorn lär sig för snabbt och generatorn kan inte återhämta sig.Mode collapse: The generator converges on producing the same image repeatedly, or a small cluster of near-identical outputs. The discriminator learns too quickly and the generator cannot recover.
- Diskriminatordominans: Med få träningsbilder memorerar diskriminatorn datasetet och avvisar allt generatorn producerar. Det adversariala spelet blir ovinnerligt.Discriminator dominance: With few training images, the discriminator memorizes the dataset and rejects everything the generator produces. The adversarial game becomes unwinnable.
- Instabil träning: Loss-värden oscillerar våldsamt. Checkpoints från angränsande epoker ger radikalt olika kvalitetsnivåer. Ingen tillförlitlig konvergensbana.Unstable training: Loss values oscillate wildly. Checkpoints from adjacent epochs produce radically different quality levels. No reliable convergence trajectory.
Vad som testades i de 17 varianternaWhat was tested across 17 variants
| VariantVariant | ModifieringModification | ResultatResult |
|---|---|---|
| Standard StyleGAN2 | Standard-hyperparametrarDefault hyperparameters | Mode-collapse vid epoch 20Mode collapse by epoch 20 |
| ADA (Adaptive Augmentation) | Dataaugmentering i diskriminatornData augmentation in discriminator | Fördröjd collapse, misslyckas ändåDelayed collapse, still fails |
| Reducerad modellReduced model | Färre kanaler, mindre mappningsnätverkFewer channels, smaller mapping network | Samma collapse med sämre kvalitetSame collapse with worse quality |
| Olika learning ratesVarious learning rates | 1e-3 to 1e-5 for G and D | Långsammare collapse, samma utfallSlower collapse, same outcome |
| Olika batch-storlekarVarious batch sizes | 2, 4, 8, 12 | Batch 12 = VRAM-gräns. Ingen förbättring.Batch 12 = VRAM limit. No improvement. |
| R1 regularization | Olika gamma-värdenDifferent gamma values | Marginell stabilitetsförbättringMarginal stability improvement |
| Path length regularization | Jämnare latent rumSmoother latent space | Ingen synlig effektNo visible effect |
StyleGAN2 har ungefär 30 miljoner parametrar. Med 7 843 träningsbilder är det ~3 800 parametrar per träningsbild. Jämförelsevis har FFHQ-träning ~430 parametrar per bild. Modellen har för många frihetsgrader i förhållande till de begränsningar datan ger.StyleGAN2 has approximately 30 million parameters. With 7,843 training images, that is ~3,800 parameters per training image. For comparison, FFHQ training has ~430 parameters per image. The model has too many degrees of freedom relative to the constraints provided by the data.
De 150 timmarna var inte bortkastade. De etablerade ett kritiskt negativt resultat: standard-GAN-arkitekturer designade för stora, homogena dataset kan inte skalas ner till små, heterogena genom att bara justera hyperparametrar. Den fundamentala arkitekturen måste ändras.The 150 hours spent here were not wasted. They established a critical negative result: standard GAN architectures designed for large, homogeneous datasets cannot be scaled down to small, heterogeneous ones by simply adjusting hyperparameters. The fundamental architecture must change.
Datum: 7 februari 2026, 23:45 | Händelse: Total systemfrysning under träningDate: February 7, 2026, 23:45 | Event: Complete system freeze during training
Under en latent diffusion-körning tog minnet slut och systemet frös totalt. Skärmen blev svart. Inget tangentbordssvar. Enda alternativet: håll strömknappen i 5 sekunder och hoppas att det senaste checkpointet sparades.During a latent diffusion training run, the system ran out of memory and froze completely. The screen went black. No keyboard response. The only option: hold the power button for 5 seconds and hope the last checkpoint was saved.
Det var inte den första frysningen. Dagen innan (6 februari) hade systemet också frusit vid epoch 8 av ett latent diffusion-experiment och förlorat 1,2 timmars träning. Orsaken: konturmedveten loss kombinerad med stor batch-storlek förbrukade alla 6 GB VRAM samtidigt, vilket utlöste ett out-of-memory-tillstånd som Linux-kärnan inte kunde återhämta sig från.This was not the first freeze. The previous day (February 6) the system had also frozen at epoch 8 of a latent diffusion experiment, losing 1.2 hours of training. The cause: contour-aware loss combined with a large batch size consumed all 6 GB of VRAM simultaneously, triggering an out-of-memory condition that the Linux kernel could not recover from.
Efter omstart genomfördes en grundlig räddningssession. Varje checkpoint undersöktes. Varje komponent utvärderades ärligt. Det resulterande dokumentet, RADDNINGSRAPPORT.md, är den mest ärliga bedömningen i projektets historia.After reboot, a comprehensive rescue session was conducted. Every checkpoint was examined. Every component was honestly evaluated. The resulting document, RADDNINGSRAPPORT.md, is the most honest assessment in the project's history.
Ärlig bedömning vid tidpunkten för räddningenHonest assessment at the time of rescue
| KomponentComponent | StatusStatus | Ärlig utvärderingHonest evaluation |
|---|---|---|
| VAE v3 (Vaeana) | FungerarWorking | MSE 0,0128, 11 M params, latent 8×32×32. God struktur, separationskvot 7,79.MSE 0.0128, 11M params, latent 8x32x32. Good structure, separation ratio 7.79. |
| NadjaEMBED | ÖvertränadOvertrained | Bäst vid epoch 20 (val_loss 2,88), sämre vid epoch 100 (3,50). Bara 14 % recall.Best at epoch 20 (val_loss 2.88), got worse by epoch 100 (3.50). Only 14% recall. |
| Latent Diffusion | PlatåPlateaued | Epoch 46/150, val_loss 0,3491, ingen förbättring sedan epoch 40.Epoch 46/150, val_loss 0.3491, no improvement since epoch 40. |
Vad modellen kunde göraWhat the model could do
- Generera texturer och materialliknande ytorGenerate textures and material-like surfaces
- Svara på materialprompter: "glas" gav blå-transparenta toner, "metall" gav metalliska ytorRespond to material prompts: "glass" produced blue-transparent tones, "metal" produced metallic surfaces
- Variera utdataintensitet via CFG-skalaVary output intensity via CFG scale
Vad modellen INTE kunde göraWhat the model could NOT do
- Generera objekt eller skulpturer (inga konturer, ingen form)Generate objects or sculptures (no contours, no form)
- Producera figur-bakgrundsdelning (allt var textur på textur)Produce figure-ground separation (everything was texture-on-texture)
- Undvika textartefakter vid vissa promptkonfigurationerAvoid text artifacts at certain prompt configurations
- Förbättras bortom epoch 40 (fundamental platå)Improve beyond epoch 40 (fundamental plateau)
Räddningsrapporten erbjöd fyra möjliga vägar framåt:The rescue report offered four possible paths forward:
- Acceptera som textur-/stämningsgenerator — omedelbart avvisat (bryter mot DEC-002)Accept as texture/mood generator -- immediately rejected (violates DEC-002)
- Kurera dataset till 500–1 000 fokuserade bilder — uppskattad tid 2–4 dagarCurate dataset to 500-1000 focused images -- estimated 2-4 days
- Lägg till förtränad backbone — avvisat (bryter mot DEC-001, from-scratch-principen)Add pretrained backbone -- rejected (violates DEC-001, from-scratch principle)
- Ny arkitektur (Slot Attention) — uppskattad tid 1–2 veckorNew architecture (Slot Attention) -- estimated 1-2 weeks
Frysningen ledde också till ny säkerhetsinfrastruktur: watchdog-skript som övervakar GPU-temperatur, VRAM-användning och system-RAM var 10:e sekund och automatiskt avslutar träningsprocessen innan systemet kan frysa. Maximalt 5 automatiska omstarter. Pausfunktion via en touch-fil. Dessa skript användes i varje efterföljande experiment.The freeze also led to new safety infrastructure: watchdog scripts that monitor GPU temperature, VRAM usage, and system RAM every 10 seconds, automatically killing the training process before the system can freeze. Maximum 5 automatic restarts. Pause functionality via a touch file. These scripts remained in use for every subsequent experiment.
Period: 6–13 februari 2026 | Längd: ~80 timmar | Experiment: 5Period: February 6-13, 2026 | Duration: ~80 hours | Experiments: 5
Efter GAN-misslyckandena vände projektet sig till diffusionsmodeller, som lär sig generera bilder genom att vända på en brusläggningsprocess. Till skillnad från GAN kräver diffusionsmodeller ingen adversarial träning, vilket borde göra dem stabilare på små dataset.After the GAN failures, the project turned to diffusion models, which learn to generate images by reversing a noise-adding process. Unlike GANs, diffusion models do not require adversarial training, which should make them more stable on small datasets.
EXP-018 Pixeldiffusion: En U-Net tränad att förutsäga brus i pixelrymden (256×256×3 = 196 608 dimensioner). Modellen minimerar MSE mellan förutsagt och faktiskt brus. Under 300 epoker lärde sig modellen förutsäga det genomsnittliga bruset och producerade bilder som konvergerade mot datasettets medelvärde: ett urblekt brungrått suddigt inget med ingen rumslig struktur. Det är matematiskt förväntat. MSE-minimering på heterogen data ger det statistiska genomsnittet.Pixel Diffusion: A U-Net trained to predict noise in pixel space (256x256x3 = 196,608 dimensions). The model minimizes mean squared error between predicted and actual noise. Over 300 epochs, the model learned to predict the average noise, producing images that converge on the dataset mean: a washed-out brownish-gray blur with no spatial structure. This is mathematically expected. MSE minimization on heterogeneous data produces the statistical average.
EXP-019 CLIP Diffusion: Försökte använda CLIP-embeddings för genereringsstyrning. Omedelbart övergiven. CLIP är förtränad på 400 miljoner internetbild-textpar. Att använda den skulle injicera visuell kunskap från utanför Nadjas dataset och fundamentalt bryta mot from-scratch-principen. Till och med att använda CLIP för utvärdering (FID-poäng kräver förtränad Inception) avvisades.CLIP Diffusion: Attempted to use CLIP embeddings for generation guidance. Immediately abandoned. CLIP is pretrained on 400 million internet image-text pairs. Using it would inject visual knowledge from outside Nadja's dataset, fundamentally violating the from-scratch principle. Even using CLIP for evaluation (FID scores require pretrained Inception) was rejected.
EXP-020 NadjaEMBED: En egenutvecklad materialklassificerare (11,8 M params) tränad från grunden på datasetet självt, sedan använd för att styra diffusion. Embeddingen lärde sig svaga materialassociationer (glas kontra metall: cosinuslikhet 0,028, korrekt lågt; glas kontra kristall: 0,318, korrekt liknande) men med bara 14 % recall. För brusigt för att styra genereringen meningsfullt. Utdatan var fortfarande suddiga texturer utan objektstruktur.NadjaEMBED: A custom material classifier (11.8M params) trained from scratch on the dataset itself, then used to guide diffusion. The embedding learned weak material associations (glass vs metal: cosine similarity 0.028, correctly low; glass vs crystal: 0.318, correctly similar) but with only 14% recall. Too noisy to guide generation meaningfully. The outputs were still blurry textures without object structure.
EXP-021 SlotDiffusion: Slot attention delar upp en scen i separata objekt-"slots" och rekonstruerar varje oberoende. Kombinerat med diffusion borde det lära sig objektnivågenerering. Slot attention designades dock för syntetiska dataset (CLEVR, MOVi) med tydliga, isolerade objekt mot enhetliga bakgrunder. Nadjas fotografier är komplexa, flerskiktade och saknar tydlig figur-bakgrundsgräns i de flesta bilder. Modellen kunde inte dekomponera något meningsfullt.SlotDiffusion: Slot attention decomposes a scene into separate object "slots" and reconstructs each independently. Combined with diffusion, it should learn object-level generation. However, slot attention was designed for synthetic datasets (CLEVR, MOVi) with clear, isolated objects on uniform backgrounds. Nadja's photographs are complex, multi-layered, and have no clear figure-ground boundary in most images. The model could not decompose anything meaningful.
EXP-022 Kant-först: Extrahera Sobel-kantkartor från alla bilder, träna en GAN på kantkartorna (som är enklare), sedan kolorera. Kantkartorna visade sig för glesa för GAN-träning. De flesta bilder har svaga eller diffusa kanter och kantkartorna kollapsade till nästan tomma bilder. En GAN tränad på mestadels tomma bilder producerar tomma bilder.Edge-First: Extract Sobel edge maps from all images, train a GAN on the edge maps (which are simpler), then colorize. The edge maps proved too sparse for GAN training. Most images have weak or diffuse edges, and the edge maps collapsed to near-empty images. A GAN trained on mostly-empty images produces empty images.
Period: 14–17 februari 2026 | Längd: ~15 timmar | Experiment: 5Period: February 14-17, 2026 | Duration: ~15 hours | Experiments: 5
Efter 22 misslyckade experiment och 230 timmars GPU-tid, en fundamentalt annorlunda ansats. Istället för att generera 256×256-bilder på en gång börjar modellen vid 4×4-upplösning och ökar gradvis: 4×4 → 8×8 → 16×16 → 32×32 → 64×64 → 128×128. Varje nivå tränas tills den är stabil innan nästa introduceras.After 22 failed experiments and 230 hours of GPU time, a fundamentally different approach. Instead of generating 256x256 images in one shot, the model starts at 4x4 resolution and gradually increases: 4x4 -> 8x8 -> 16x16 -> 32x32 -> 64x64 -> 128x128. Each level trains until stable before the next is introduced.
Det förändrar inlärningsproblemet helt. Vid 4×4 (16 pixlar) behöver modellen bara lära sig grova färgfördelningar. Vid 8×8 grundläggande rumslig layout. Vid 16×16 grova former. Varje upplösningsnivå ärver stabila egenskaper från föregående nivå och behöver bara lära sig den extra detalj som hör till dess skala. Modellen möter aldrig hela 256×256-genereringsproblemet på en gång.This changes the learning problem entirely. At 4x4 (16 pixels), the model only needs to learn rough color distributions. At 8x8, basic spatial layout. At 16x16, coarse shapes. Each resolution level inherits stable features from the previous level and only needs to learn the additional detail at its own scale. The model never faces the full 256x256 generation problem at once.
EXP-023 Progressiv L0–4 (upp till 64×64): Första gången modellen genererade igenkännbara FORMER. Vid nivå 4 (64×64) dök klumpar med definierade kanter och rumslig struktur upp. De hade figur-bakgrundsdelning, något inget tidigare visat. Efter 22 experiment av ingenting annat än brus, texturer och mode-collapse var det att se en centrerad form med definierad gräns ett genombrytande ögonblick.Progressive L0-4 (up to 64x64): The first time the model generated recognizable FORMS. At level 4 (64x64), blobs with defined edges and spatial structure appeared. They had figure-ground separation, which nothing before them had shown. After 22 experiments of nothing but noise, textures, and mode collapse, seeing a centered form with a defined boundary was a breakthrough moment.
EXP-025 Progressiv L5 (128×128): GENOMBROTTET. Efter ~4 timmars träning (50 epoker vid nivå 5, WGAN-GP loss) producerade modellen utdata med sju identifierbara egenskaper:Progressive L5 (128x128): THE breakthrough. After ~4 hours of training (50 epochs at level 5, WGAN-GP loss), the model produced outputs with seven identifiable properties:
- Dokumentliknande mönster: textliknande strukturer (inlärda från skärmdumpar och dokument i datasetet)Document-like patterns: text-like structures (learned from the screenshots and documents in the dataset)
- Kristallina former: blågrön organisk struktur som liknar glasCrystalline forms: blue-green organic structures resembling glass
- Figur-bakgrundsdelning: DET FUNGERAR. Objekt mot bakgrunder.Figure-ground separation: IT WORKS. Objects against backgrounds.
- Färgrikedom: Nadjas fulla palett (inte kollapsad till grått)Color richness: Nadja's full palette (not collapsed to gray)
- Skärpa: dramatiskt bättre än 64×64Sharpness: dramatically better than 64x64
- Kompositionell variation: olika layouter per sampleCompositional variation: different layouts per sample
- Organiska former: biologiskt/naturliknande strukturerOrganic forms: biological/natural-looking structures
Progressiv GAN använder ungefär 4,5 miljoner parametrar (kontra 30 M för StyleGAN2). Det är ~574 parametrar per träningsbild, en 6,6× förbättring av parameter-till-data-förhållandet jämfört med StyleGAN2.The Progressive GAN uses approximately 4.5 million parameters (vs 30M for StyleGAN2). That is ~574 parameters per training image, a 6.6x improvement in the parameter-to-data ratio compared to StyleGAN2.
Träningsmetriker visade sund GAN-dynamik: G-loss förbättrades från 49,6 till 40,6 (18 % minskning), D-loss stabiliserades vid -5,9 (WGAN-GP målintervall). Ingen mode-collapse. Ingen diskriminatordominans.Training metrics showed healthy GAN dynamics: G-loss improved from 49.6 to 40.6 (18% reduction), D-loss stabilized at -5.9 (WGAN-GP target range). No mode collapse. No discriminator dominance.
EXP-026 Progressiv L6 (256×256): Försökte skala bortom 128×128. Resultat: NaN-losses krävde lagfrysning för att stabiliseras. Utdatan vid 256×256 var "abstrakta klumpar" — den extra upplösningen tillförde ingen meningsfull struktur. Högre upplösning kräver mer data eller mer målinriktad konditionering. Slutsatsen: 128×128 är upplösningstaket för det här datasetet med ovillkorlig generering.Progressive L6 (256x256): Attempted to scale beyond 128x128. Result: NaN losses required layer freezing to stabilize. The output at 256x256 was "abstract blobs" -- the additional resolution did not add meaningful structure. Higher resolution requires more data or more targeted conditioning. The conclusion: 128x128 is the resolution ceiling for this dataset with unconditional generation.
Period: 18–22 februari 2026 | Längd: ~35 timmar | Experiment: 9Period: February 18-22, 2026 | Duration: ~35 hours | Experiments: 9
Med progressiv GAN som producerade former kom nästa fråga: kan vi styra utdatan? Kan vi be om "glas" eller "skulptur" specifikt?With progressive GAN producing forms, the next question: can we steer the output? Can we ask for "glass" or "sculpture" specifically?
Två huvudsakliga ansatser testades: klass-konditionell GAN (lägg till kategorietiketter i både generator och diskriminator) och AC-GAN (Auxiliary Classifier GAN, där diskriminatorn också klassificerar bilder efter materialkategori).Two main approaches were tried: class-conditional GAN (add category labels to both generator and discriminator) and AC-GAN (Auxiliary Classifier GAN, where the discriminator also classifies images by material category).
EXP-027-030 Konditionell GAN (4 varianter): Lade till materialkategorietiketter som konditioneringsinsignal. Modellen fick både en brusvektor och en klassembedding. Resultat: kategorier smälter ihop. Med bara 67–523 bilder per materialklass finns otillräckliga exempel för att definiera tydliga klassgränser. Generatorn producerar kompromisser mellan klasser och blandar glasliknande transparens med keramikliknande opacitet till formlösa mellanlägen.Conditional GAN (4 variants): Added material category labels as conditioning input. The model received both a noise vector and a class embedding. Result: categories melt together. With only 67-523 images per material class, there are insufficient examples to define clear class boundaries. The generator produces compromises between classes, blending glass-like transparency with ceramic-like opacity into formless intermediate states.
EXP-031 Konditionell från grunden: Förenklades till binär konditionering (is_sculpture: 0/1). Delvis framgång — modellen svarar på konditioneringssignalen, men det binära etiketten är för grovt för att producera meningsfullt olika utdata.Conditional from scratch: Simplified to binary conditioning (is_sculpture: 0/1). Partial success -- the model responds to the conditioning signal, but the binary label is too coarse to produce meaningfully different outputs.
EXP-032-035 AC-GAN (4 varianter): Diskriminatorn har en dubbeluppgift: (1) klassificera verklig kontra falsk och (2) klassificera materialkategori. Det ger en klassifikationsgradient till generatorn. Resultat: diskriminatordominans. Diskriminatorn lär sig klassificera perfekt (både verklig/falsk och kategori) men klassificeringshuvudet skapar motstridiga gradienter för generatorn. Generatorn kan inte simultaneously maximera realism OCH matcha specifika materialkategorier med så få exempel per klass.AC-GAN (4 variants): The discriminator has a dual task: (1) classify real vs fake, and (2) classify material category. This provides a classification gradient to the generator. Result: discriminator dominance. The discriminator learns to classify perfectly (both real/fake and category) but the classification head creates conflicting gradients for the generator. The generator cannot simultaneously maximize realism AND match specific material categories with so few examples per class.
En 32-dimensionell featurevektor (färgstatistik, kantdensitet, symmetri, texturmått) testades också som konditioneringssignal. Maximalt uppmätt effekt på utdata: 0,45 på en 0–1-skala. Inte tillräckligt för att styra genereringen meningsfullt. Featurena fångar inte glassemantik.A 32-dimensional feature vector (color statistics, edge density, symmetry, texture measures) was also tested as a conditioning signal. Maximum measured effect on output: 0.45 on a 0-1 scale. Not enough to steer the generation meaningfully. The features do not capture glass-semantics.
Period: 22–24 februari 2026 | Längd: ~10 timmar | Experiment: 3Period: February 22-24, 2026 | Duration: ~10 hours | Experiments: 3
En strategisk pivotering: istället för att försöka generera bilder direkt, lär sig först ett diskret visuellt tokenvokabulär. En Vector Quantized Variational Autoencoder (VQ-VAE) komprimerar bilder till ett rutnät av diskreta koder från en inlärd kodbok. Det separerar representationsproblemet (hur bilder kodas) från genereringsproblemet (hur nya produceras).A strategic pivot: instead of trying to generate images directly, first learn a discrete vocabulary of visual tokens. A Vector Quantized Variational Autoencoder (VQ-VAE) compresses images into a grid of discrete codes from a learned codebook. This separates the representation problem (how to encode images) from the generation problem (how to produce new ones).
EXP-036 VQ-VAE 32×32 latent: Indata 128×128, komprimerat till 32×32-rutnät av kodboksindex. 512-posts kodbok, varje post 256-dimensionell. Resultat: fungerar, men förlorar fin detalj (4× rumslig nedsampling).VQ-VAE 32x32 latent: Input 128x128, compressed to 32x32 grid of codebook indices. 512-entry codebook, each entry 256-dimensional. Result: works, but loses fine detail (4x spatial downsampling).
EXP-037 VQ-VAE 64×64 latent: Samma arkitektur men bara 2× nedsampling. 4 096 tokens per bild. Bättre rekonstruktion, bevarar mer detalj.VQ-VAE 64x64 latent: Same architecture but 2x downsampling only. 4,096 tokens per image. Better reconstruction, preserves more detail.
EXP-038 Fullt dataset + augmentering: Tränad på alla 7 843 bilder med RandomCrop, Flip, ColorJitter och Rotation. 1 000 epoker. Resultat: en rikare, mer varierad kodbok. Bättre "visuellt vokabulär".Full dataset + augmentation: Trained on all 7,843 images with RandomCrop, Flip, ColorJitter, and Rotation. 1,000 epochs. Result: a richer, more diverse codebook. Better "visual vocabulary."
Över två stora träningskörningar (vqvae och vqvae_v2) ackumulerade modellen 348 checkpoints och konvergerade till en total loss på 0,0009:Across two major training runs (vqvae and vqvae_v2), the model accumulated 348 checkpoints and converged to a total loss of 0.0009:
- Rekonstruktionsloss: 0,0007 (nästan pixelperfekt rekonstruktion)Reconstruction loss: 0.0007 (near-pixel-perfect reconstruction)
- VQ commitment loss: 0,0002 (kodboken används effektivt)VQ commitment loss: 0.0002 (codebook is being used efficiently)
VQ-VAE producerar nästan perfekta rekonstruktioner. Översta raden är original, understa raden är den komprimerade och sedan dekomprimerade bilden. Modellen lärde sig framgångsrikt ett visuellt vokabulär för Nadjas bilder.The VQ-VAE produces near-perfect reconstructions. Top row is original, bottom row is the compressed-then-decompressed image. The model successfully learned a visual vocabulary for Nadja's images.
Period: 6–24 mars 2026 | Längd: ~80 timmar | Experiment: 6Period: March 6-24, 2026 | Duration: ~80 hours | Experiments: 6
Med en fungerande VQ-VAE-tokenizer (fas V) var planen elegant: träna en transformer att generera tokenföljder, avkoda dem sedan tillbaka till bilder med VQ-VAE-dekodern. Det är arkitekturen bakom DALL-E 1, Parti och MaskGIT. Tvåstegssättet (tokenisera, sedan modellera tokens) är det dominerande paradigmet i modern bildgenerering.With a working VQ-VAE tokenizer (Phase V), the plan was elegant: train a transformer to generate token sequences, then decode them back to images with the VQ-VAE decoder. This is the architecture behind DALL-E 1, Parti, and MaskGIT. The two-stage approach (tokenize, then model tokens) is the dominant paradigm in modern image generation.
Token Transformer (EXP-039, EXP-040)
EXP-039 Token Transformer V1: En autoregressiv transformer (98 tränade checkpoints) som förutsäger nästa token i en rastersekvens (vänster till höger, uppifrån ner). Etablerade en stabil baslinje. Modellen lärde sig tokenstatistik, men genererade bilder visade rasterbias: horisontella randmönster från vänster-till-höger genereringsordningen. Varje rad börjar oberoende.Token Transformer V1: An autoregressive transformer (98 checkpoints trained) that predicts the next token in a raster-scan sequence (left-to-right, top-to-bottom). Established a stable baseline. The model learned token statistics, but generated images showed raster bias: horizontal stripe patterns from the left-to-right generation order. Every row starts independently.
EXP-040 Token Transformer V2: Försökte åtgärda rasterbiasEN med 2D positionskodning och modifierad attention. Biasen kvarstod, nu uttryckt som ett rutmönster. Det fundamentala problemet: autoregressiv generering påtvingar en ordning som bilder inte har. Pixlar (och tokens) har rumsliga relationer, inte sekventiella.Token Transformer V2: Attempted to fix raster bias with 2D positional encoding and modified attention. The bias remained, now expressed as a grid pattern. The fundamental issue: autoregressive generation imposes an ordering that images do not have. Pixels (and tokens) have spatial relationships, not sequential ones.
MaskGIT (EXP-041 to EXP-044)
MaskGIT löser ordningsproblemet genom att generera alla tokens simultant: maskera slumpmässiga tokens, förutsäg dem alla på en gång (som BERT för bilder), behåll de mest säkra förutsägelserna, maskera om resten och iterera. Ingen rasterscan, ingen ordningsbias.MaskGIT solves the ordering problem by generating all tokens simultaneously: mask random tokens, predict them all at once (like BERT for images), keep the most confident predictions, re-mask the rest, and iterate. No raster scan, no ordering bias.
Fyra MaskGIT-varianter testades under ~40 timmar:Four MaskGIT variants were tested over ~40 hours:
| ID | VariantVariant | TokensTokens | LossLoss | ResultatResult |
|---|---|---|---|---|
| EXP-041 | Standard MaskGIT (3.7M params) | 512 | 3.4 | Spridda vita prickar på vittScattered white dots on white |
| EXP-042 | MaskGIT 128x128 | 512 | 3.4 | Samma prickar. Men inpainting fungerar!Same dots. But inpainting works! |
| EXP-043 | CTF (Clustered Token Flow, 32 clusters) | 32 | 0.85 | Mode-collapse till grå blockMode collapse to gray blocks |
| EXP-044 | CTF balanced sampling | 32 | 1.06 | Ljusa/mörka randmönsterLight/dark stripe patterns |
RotorsaksanalysRoot cause analysis
En grundlig post-mortem (ANALYS_MASKGIT.md, 24 mars 2026) identifierade fyra rotorsaker:A comprehensive post-mortem (ANALYS_MASKGIT.md, March 24, 2026) identified four root causes:
- Katastrofalt obalanserad tokenfördelning: VQ-VAE-kodboken har 512 poster, men bara 4 poster svarar för 76,5 % av alla tokens. Dessa 4 koder representerar bakgrund/tomrum/neutrala toner. När transformern förutsäger "vilket token hör hemma här?" är det statistiskt korrekta svaret nästan alltid en av dessa 4 bakgrundskoder. Ovillkorlig generering fyller därför hela rutnätet med bakgrund.Catastrophically imbalanced token distribution: The VQ-VAE codebook has 512 entries, but just 4 entries account for 76.5% of all tokens. These 4 codes represent background/empty space/neutral tones. When the transformer predicts "what token goes here?", the statistically correct answer is almost always one of these 4 background codes. Unconditional generation therefore fills the entire grid with background.
- För många tokens (16 384 per bild): Vid 128×128 med kodboksstorlek 512 blir varje bild ett 128×128-rutnät. Window attention (nödvändig för minnet) kan inte se global kontext. Global attention skulle kräva 268 M attention-poster — OOM på 6 GB VRAM.Too many tokens (16,384 per image): At 128x128 with codebook size 512, each image becomes a 128x128 grid. Window attention (required for memory) cannot see global context. Global attention would require 268M attention entries -- OOM on 6 GB VRAM.
- För lite data (6 806 bilder): Med 6 806 heterogena bilder har transformern otillräckliga exempel för att lära sig meningsfulla rumsliga token-samlingsförekomstmönster.Too little data (6,806 images): With 6,806 heterogeneous images, the transformer has insufficient examples to learn meaningful spatial token co-occurrence patterns.
- Ovillkorlig generering är matematiskt underbestämd: Utan någon konditioneringssignal (textprompt, klassetikett, delvis bild) måste modellen generera "en trovärdig bild" från ingenting. Med heterogen data är den mest trovärdiga utdatan den vanligaste utdatan: bakgrund.Unconditional generation is mathematically underdetermined: Without any conditioning signal (text prompt, class label, partial image), the model must generate "a plausible image" from nothing. With heterogeneous data, the most plausible output is the most common output: background.
Kritiskt fynd: I EXP-042 fungerade MaskGIT-inpainting. När den fick en riktig bild med vissa tokens maskerade fyllde modellen i de maskerade regionerna koherent. Det bevisar att modellen lärde sig meningsfulla tokenrelationer. Men utan initial kontext (ovillkorlig) faller den tillbaka på majoritetsklassen.Critical discovery: In EXP-042, MaskGIT inpainting worked. When given a real image with some tokens masked, the model filled in the masked regions coherently. This proves the model learned meaningful token relationships. But without any initial context (unconditional), it defaults to the majority class.
Period: 24–25 mars 2026 | Längd: ~5 timmar | Experiment: 2Period: March 24-25, 2026 | Duration: ~5 hours | Experiments: 2
Efter MaskGIT-misslyckandets analys, en medveten återgång till den arkitektur som faktiskt fungerade. Frågan: var fas III-resultaten reproducerbara, eller var de en lycklig tillfällighet i en stokastisk process?After the MaskGIT failure analysis, a deliberate return to the architecture that actually worked. The question: were the Phase III results reproducible, or a lucky fluke from a stochastic process?
EXP-045 Progressiv GAN (återgång): Körde om den progressiva GAN-pipelinen från grunden. På ungefär 10 minuter bekräftade modellen: progressiv tillväxt producerar fortfarande de bästa resultaten av alla testade arkitekturer. Resultatet var ingen slump. Arkitekturen genererar tillförlitligt strukturerade former på det här datasetet.Progressive GAN (return): Re-ran the progressive GAN pipeline from scratch. In approximately 10 minutes, the model confirmed: progressive growing still produces the best results of any architecture tested. The result was not a fluke. The architecture reliably generates structured forms on this dataset.
EXP-046 Progressiv L5 fortsättning: Fortsatte träning från nivå 5-checkpointet (epoch 50) till epoch 100. Träning pågick från 22:10 den 24 mars till 02:43 den 25 mars (4,5 timmar). GPU-temperaturen nådde som mest 71°C. VRAM låg mellan 1,6–2,5 GB. Noll krascher.Progressive L5 continuation: Continued training from the Level 5 checkpoint (epoch 50) through epoch 100. Training ran from 22:10 on March 24 to 02:43 on March 25 (4.5 hours). GPU temperature peaked at 71C. VRAM stayed between 1.6-2.5 GB. Zero crashes.
Diskriminatorlossen stabiliserades kring -10 från epoch 65 och framåt, vilket indikerar att det adversariala spelet nått jämvikt. De 50 extra epokerna producerade synliga förbättringar:The discriminator loss stabilized around -10 from epoch 65 onward, indicating the adversarial game had reached equilibrium. The 50 additional epochs produced visible improvements:
- Mer definierade objektgränser och konturerMore defined object boundaries and contours
- Rikare ytatexturer (metalliska, organiska, glasliknande)Richer surface textures (metallic, organic, glass-like)
- Bättre figur-bakgrundsdelning med mörkare/neutrala bakgrunderBetter figure-ground separation with darker/neutral backgrounds
- Större kompositionell mångfald över samplesGreater compositional diversity across samples
- Vissa bilder innehåller igenkännbara skulpturala element: kärl, gjutna former, sammansatta objektSome images contain recognizable sculptural elements: vessels, cast forms, assembled objects
Avtagande avkastning var tydlig från epoch 65. Grundproblemet (heterogent dataset, ovillkorlig generering) kan inte lösas med mer träning. Modellen har lärt sig vad den kan lära sig från den här datan vid den här upplösningen.However, diminishing returns were clear from epoch 65. The root problem (heterogeneous dataset, unconditional generation) cannot be solved with more training. The model has learned what it can learn from this data at this resolution.
Under hela projektet utforskade flera sidoexperiment alternativa ansatser. De stod utanför huvudspåret och gav extra insikter, i vissa fall de visuellt mest övertygande utdatan i hela projektet.Throughout the project, several side experiments explored alternative approaches. These sat outside the main trajectory and gave extra insight, in some cases the most visually compelling outputs of the whole project.
Lättvikts-/turbo-varianterLightweight / Turbo variants
Snabboptimerade progressiva GAN med aggressivt reducerade parameterantal. "Turbo"-varianten producerade några av de mest slående utdatan: biomorfiska, organiska former med glasliknande translucens, tydlig figur-bakgrundsdelning mot neutrala grå bakgrunder och skulptural närvaro. Dessa former liknar biologiska specimen, gjutna glasobjekt och sammansatta skulpturer. Det reducerade parameterantalet kan ha fungerat som regularisering och hindrat modellen från att memorera datasetspecifika texturer och istället lära sig strukturella primitiver.Speed-optimized progressive GANs with aggressively reduced parameter counts. The "turbo" variant produced some of the most striking outputs: biomorphic, organic forms with glass-like translucency, clear figure-ground separation on neutral gray backgrounds, and sculptural presence. These forms resemble biological specimens, cast glass objects, and assembled sculptures. The reduced parameter count may have acted as regularization, preventing the model from memorizing dataset-specific textures and instead learning structural primitives.
PixelGPT
Autoregressiv pixel-för-pixel-generering vid 64×64. Modellen förutsäger varje pixelvärde konditionerat på alla föregående pixlar (i rasterordning). Resultat: lär sig färgfördelningar men inte rumslig struktur. Varje rad börjar ett nytt färgfält och skapar horisontella randmönster. En färgpalettanalys visade att modellen lärde sig Nadjas färgvokabulär (bärnstensgult, blågrönt, grått, svart, vitt) utan att lära sig hur det arrangeras rumsligt.Autoregressive pixel-by-pixel generation at 64x64. The model predicts each pixel value conditioned on all previous pixels (in raster order). Result: learns color distributions but not spatial structure. Each row begins a new color field, creating horizontal stripe patterns. A color palette analysis showed the model learned Nadja's color vocabulary (amber, teal, gray, black, white) without learning how to arrange it spatially.
Strukturerad autoencoderStructured Autoencoder
Autoencoder med strukturella begränsningar (kantkonsistens, konturbevarelse). Producerar mjuka interpolationer mellan träningsbilder i det latenta rummet. Användbart för att förstå den latenta manifolden men inte för ny generering. Interpolationerna genomkorsar ett kontinuerligt rum av träningsbildsliknande texturer.Autoencoder with structural constraints (edge consistency, contour preservation). Produces smooth interpolations between training images in latent space. Useful for understanding the latent manifold but not for novel generation. The interpolations traverse a continuous space of training-image-like textures.
Flow Matching
Ett modernt alternativ till diffusion som lär sig direkta deterministiska banor från brus till data (istället för stokastisk diffusion/avbrusning). Vid epoch 20 producerar den spöklika, halvtransparenta kompositioner med skiktat rumslig struktur. Utdatan har en eterisk kvalitet som skiljer sig från alla andra arkitekturer. Undertränad (bara 20 epoker) men lovande för framtida utforskning.A modern alternative to diffusion that learns direct deterministic trajectories from noise to data (instead of stochastic diffusion/denoising). At epoch 20, produces ghostly, semi-transparent compositions with layered spatial structure. The outputs have an ethereal quality distinct from any other architecture. Undertrained (only 20 epochs) but promising for future exploration.
Progressiv isolerad / kureradProgressive Isolated / Curated
Progressiv GAN tränad på kurerade delmängder: isolerade objekt (4 133 bilder) och strikt kurerade skulpturer (300–917 bilder). Det isolerade datasetet producerade renare figur-bakgrundsdelning. De kurerade dataseten producerade mer koherenta objekt men med minskad mångfald. Datasetkuration styr direkt avvägningen mellan mångfald och strukturell koherens.Progressive GAN trained on curated subsets: isolated objects (4,133 images) and strictly curated sculptures (300-917 images). The isolated dataset produced cleaner figure-ground separation. The curated datasets produced more coherent objects but with reduced diversity. Dataset curation directly controls the trade-off between diversity and structural coherence.
Under hela projektet dokumenterades sju formella beslut. Varje beslut skrevs som svar på en specifik kris eller insikt och förblev aktivt för resten av projektet. Tillsammans definierar de det filosofiska ramverket inom vilket alla experiment genomfördes.Throughout the project, seven formal decisions were documented. Each was written as a response to a specific crisis or insight, and each remained active for the remainder of the project. Together they define the philosophical framework within which all experiments operated.
| ID | DatumDate | ExperimentExperiment | ArkitekturArchitecture | TidTime | StatusStatus | NyckelobservationKey finding |
|---|---|---|---|---|---|---|
| 001-017 | Nov '25 - Feb '26 | StyleGAN2 variants | StyleGAN2 | ~150h | MISSLYCKADESFAILED | All mode-collapse. 30 M params för många.All mode-collapsed. 30M params too many. |
| 018 | 2026-02-06 | Pixel Diffusion | U-Net Diffusion | ~28h | MISSLYCKADESFAILED | MSE medelvärdar till datasettets medelvärdeMSE averages to dataset mean |
| 019 | 2026-02-07 | CLIP Diffusion | CLIP + Diffusion | ~1h | ÖVERGIVENABANDONED | Bryter mot from-scratch-principenViolates from-scratch principle |
| 020 | 2026-02-08 | NadjaEMBED | Custom Embed + Diffusion | ~20h | MISSLYCKADESFAILED | 14 % recall, fortfarande suddigt14% recall, still blurry |
| 021 | 2026-02-08 | SlotDiffusion | Slot Attention + Diffusion | ~15h | MISSLYCKADESFAILED | Designad för syntetisk dataDesigned for synthetic data |
| 022 | 2026-02-09 | Edge-First | Edge GAN + Colorize | ~16h | MISSLYCKADESFAILED | Kantkartor för glesa för GANEdge maps too sparse for GAN |
| 023 | 2026-02-14 | Progressive L0-4 | Progressive GAN | ~3h | FRAMGÅNGSUCCESS | Första former vid 64×64!First forms at 64x64! |
| 024 | 2026-02-15 | Progressive + ADA | Progressive + ADA | ~2h | ÖVERGIVENABANDONED | ADA-augmentering behövdes inteADA augmentation not needed |
| 025 | 2026-02-15 | Progressive L5 | Progressive GAN 128x128 | ~4h | BÄSTA RESULTATETBEST RESULT | GENOMBROTT: skulpturformer!BREAKTHROUGH: sculpture forms! |
| 026 | 2026-02-16 | Progressive L6 | Progressive GAN 256x256 | ~6h | DELVISPARTIAL | NaN + abstrakta klumpar. 256×256 för svårt.NaN + abstract blobs. 256x256 too hard. |
| 027-030 | Feb 18-21 | Conditional GAN | cGAN | ~20h | MISSLYCKADESFAILED | Kategorier smälter ihopCategories melt together |
| 031 | 2026-02-21 | Conditional scratch | Binary cGAN | ~5h | DELVISPARTIAL | Svarar på signal men svag effektResponds to signal but weak effect |
| 032-035 | Feb 21-22 | AC-GAN variants | AC-GAN | ~10h | MISSLYCKADESFAILED | DiskriminatordominansDiscriminator dominance |
| 036-038 | Feb 22-24 | VQ-VAE | VQ-VAE | ~10h | FRAMGÅNGSUCCESS | Loss 0,0009. Fungerande tokenizer.Loss 0.0009. Working tokenizer. |
| 039 | 2026-03-06 | Token Transformer V1 | Autoregressive Transformer | ~30h | FRAMGÅNGSUCCESS | Stabil baslinje (men rasterbias)Stable baseline (but raster bias) |
| 040 | 2026-03-09 | Token Transformer V2 | 2D Transformer | ~10h | DELVISPARTIAL | Rutmönster (rasterbias kvarstår)Grid patterns (raster bias persists) |
| 041 | Mar 11-15 | MaskGIT | MaskGIT (3.7M) | ~15h | MISSLYCKADESFAILED | Spridda prickar (tokenobalans)Scattered dots (token imbalance) |
| 042 | 2026-03-24 | MaskGIT 128x128 | MaskGIT | ~8h | MISSLYCKADESFAILED | Inpainting OK, ovillkorlig = prickarInpainting OK, unconditional = dots |
| 043 | 2026-03-24 | CTF MaskGIT | MaskGIT + 32 clusters | ~10h | MISSLYCKADESFAILED | Mode-collapse till gråttMode collapse to gray |
| 044 | 2026-03-24 | CTF balanced | MaskGIT + balanced | ~7h | DELVISPARTIAL | Ljusa/mörka mönsterLight/dark patterns |
| 045 | 2026-03-24 | Progressive (return) | Progressive GAN | ~10min | BEKRÄFTATCONFIRMED | Fortfarande bäst efter 400 timmarStill the best after 400 hours |
| 046 | Mar 24-25 | Progressive L5 cont. | Progressive GAN | ~4.5h | FRAMGÅNGSUCCESS | Epoch 100. Avtagande avkastning från 65.Epoch 100. Diminishing returns from 65. |