| brein | neuronen | samenstelling (start → eind) | verb. | succes | laatste 20 | toets | stappen | beloning | lussen | reflex | omgetypt | tijd |
|---|
nNeurons, density, nObs, maxSteps, worldEvery, seed, lr, lam, decay, wmax, stepMax, memLeak, prop, noise0, lrAnneal, structOn, structEvery, pruneT, sprout, growOn, growStagnant, growMax, growN, newLinks, retypeOn, retypeN, retypeCost, rGoal, rProg, rCol, rStep, rIdle, nEpisodes, evalOn, evalMode, inputOnlySens, traceOud, benchOn, benchN, benchReps. Met "layered": true plus "layerSizes": [150] draait dezelfde leerregel op een gelaagd netwerk in plaats van op de wolk — de basislijn die laat zien wat de graafstructuur toevoegt; zet daar "structOn": false bij, anders blijft er van de lagen niets over. Types uitzetten kan met "types.mem.on": false. traceOud:true zet de foutieve postsynaptische eligibility-trace van vóór 9 september 2026 terug — alleen bedoeld als ablatie. Sinds stap 7 ook criticOn, criticLr, criticGamma, perturbFrac, catPolicy, perturbGain: de vier ingrepen in de leerregel, elk los aan en uit te zetten zodat ze ook als ablatie meetbaar zijn.| conditie | zaad | succes | laatste 20 | toets | bench geloot | bench argmax | neuronen | verb. | actief | reflex | lussen | pad | tijd |
|---|
Acht sensoren meten in acht richtingen (N, NO, O, ZO, Z, ZW, W, NW) de afstand tot het dichtstbijzijnde obstakel of de wereldrand; de waarde loopt van 0 (niets in de buurt) tot 1 (er staat iets vlak voor je). Acht andere sensoren doen hetzelfde voor het doel: hoe dichterbij het doel ligt en hoe beter die richting naar het doel wijst, hoe hoger de waarde. Meer krijgt het brein niet — geen coördinaten, geen kaart, geen geheugen van de wereld.
Vier knoppen: omhoog, omlaag, links, rechts. Elke knop met een waarde boven de drempel wordt ingedrukt; twee tegelijk levert een diagonaal. Niets indrukken mag ook — dat kost wel beloning.
Geen lagen. Je bepaalt hoeveel neuronen er beschikbaar zijn en van welk type, en de verbindingen worden willekeurig gelegd binnen de regels per type. Daarna is alles dynamisch: er is geen minimum of maximum aantal verbindingen per neuron. De enige harde eis is dat elke invoer-node ergens naartoe gaat en elke uitvoer-node ergens vandaan komt.
Elke verbinding houdt een spoor bij: was ik net actief terwijl mijn doelneuron ook actief was? Dat spoor vervaagt met λ. Komt er beloning binnen, dan wordt elk gewicht bijgesteld met Δw = η · beloning · spoor. Drie remmen zorgen dat het niet ontspoort: de aanpassing per stap is begrensd (niet abrupt), de aanpassing wordt kleiner naarmate een gewicht zijn plafond nadert (niet oneindig versterken), en alles zakt elke stap een beetje naar nul (vervagen). Dit heet reward-gemoduleerde Hebbiaanse plasticiteit; het is hoe leren in echte zenuwstelsels grofweg beschreven wordt, en het werkt ook in netwerken vol lussen — waar backpropagation vastloopt.
De wolk ligt niet vast. Loopt het leren vast, dan mogen er nieuwe neuronen bijgroeien; die komen neutraal binnen — ze horen nog nergens bij, mogen alles, en krijgen een paar willekeurige verbindingen. Bij de eerstvolgende opruimronde bepaalt het systeem welke soort het beste past bij de bedrading die zo'n neuron inmiddels heeft: hangt het alleen aan invoer-nodes, dan wordt het een invoer-neuron; zit het tussen invoer-neuronen en knoppen, dan een reflex; zit het in een lus, dan geheugen; en anders worker.
Ook bestaande neuronen mogen van soort wisselen, maar alleen als dat bijna geen gewicht kost — de verbindingen die door de nieuwe regels verboden worden, moeten immers weg. Zo verandert de samenstelling geleidelijk mee met wat het brein werkelijk doet, in plaats van vast te liggen op wat jij vooraf hebt ingesteld. Een neuron dat al zijn verbindingen kwijtraakt, wordt weer neutraal: vrij materiaal om opnieuw in te zetten. De meerderheidsregel voor workers blijft altijd gelden, en jouw minima en maxima per soort zijn de grenzen waarbinnen dit gebeurt.
Om de zoveel pogingen wordt opgeruimd: verbindingen die te lang te zwak zijn verdwijnen, en er groeien nieuwe verbindingen bij op plekken waar weinig zit — altijd binnen de typeregels, en nooit zo dat een invoer- of uitvoer-node losraakt. Daardoor is de structuur die je aan het eind ziet niet degene die je hebt ingesteld, maar degene die het brein zelf overgehouden heeft.
Interessant is niet alleen of het doel gehaald wordt, maar wát er is ontstaan: hoeveel reflexbogen (sensor → reflex → knop), hoeveel lussen door geheugen-neuronen, welke sensoren volledig genegeerd worden, en of het kortste pad van invoer naar uitvoer twee stappen is of zes. Een brein dat het in de trainingswereld goed doet maar op de toetswerelden instort, heeft de route uit z'n hoofd geleerd in plaats van te leren navigeren — precies dezelfde faalvorm als een te klein of te lang doorgetraind taalmodel.