WEBVTT

1
00:00:00.180 --> 00:00:09.860
Welkom bij AI Report, de Nederlandse podcast over kunstmatige intelligentie. Zoals beloofd als GPT-5 zou uitkomen tijdens de vakantie gaan wij opnemen en dat hebben we gedaan.

2
00:00:10.040 --> 00:00:21.080
Ik heb Rik Lamers van Groq met een Q in de aflevering. Rik weet ontzettend veel over de ins en outs van taalmodellen, inference, chips, noem het allemaal maar op. Al met al een hele interessante aflevering.

3
00:00:21.100 --> 00:00:30.260
We praten over GPT-5, over GPT-OSS en we praten over Genie 3 van DeepMind. Uh, veel luisterplezier en geniet nog even van jullie vakantie.

4
00:00:40.310 --> 00:00:50.400
[muziek] Hoe zit jij er nu bij na alle vuurwerk van gisteren? Ja, dus ik heb, uh, gisteren tot in de late uurtjes met GPT-5, uh, lopen programmeren.

5
00:00:50.680 --> 00:00:59.460
Ook omdat één belangrijk onderdeel van de lancering van het model was dat, uh, ze heel erg benadrukken dat het goed werkt voor programmeren, voor code.

6
00:01:00.180 --> 00:01:08.240
En, uhm, ik vind het, uh, ik vind het een leuke, dit is een leuke meme en het is een soort van: it's a good model, sir.

7
00:01:08.840 --> 00:01:20.000
Dat is wat, uh, dat, dat was volgens mij waar de livestream van Groq-4 mee eindigde en het is een beetje een meme geworden. Groq-4 is, uh, niet het model van OpenAI, maar van xAI van Elon Musk.

8
00:01:20.680 --> 00:01:31.740
En, uh, dat it's a good model, sir, dat, dat, dat thema kwam ook een beetje terug bij, uh, GPT-5, uhm, en zeker ook online, zeg maar.

9
00:01:31.800 --> 00:01:42.620
Er zijn een aantal mensen, uh, er zijn een aantal mensen in de community, hè, de, het zijn een soort, uh, het is wel grappig, sommige mensen noemen, uh, noemen die mensen LLM-sommeliers. Mooi.

10
00:01:42.900 --> 00:01:50.900
Omdat, omdat het zo lastig tegenwoordig is om te kwantificeren: is een model nou goed? Omdat er heel veel wordt gedaan aan zogenaamde benchmark ma-maxing.

11
00:01:51.240 --> 00:01:57.680
Dus dan neem je de, de belangrijkste gestandaardiseerde tests die ze gebruiken om te aangeven hoe goed een model is.

12
00:01:57.700 --> 00:02:03.200
En dan gaan die bedrijven daar natuurlijk allemaal heel erg voor optimaliseren, zodat ze daar heel goed op scoren.

13
00:02:03.220 --> 00:02:10.979
Maar er zijn gewoon releases geweest in het verleden waarbij er modellen uitkwamen die heel goed daarop scoorden en dan, uh, uiteindelijk in echt gebruik heel erg tegenvielen.

14
00:02:11.000 --> 00:02:17.320
En dan had iedereen zovan: wat is er aan de hand? En uiteindelijk werd gewoon duidelijk dat heel veel van die labs dan heel erg optimaliseren voor die specifieke toetsen.

15
00:02:17.360 --> 00:02:28.040
En die toetsen, die worden dan eigenlijk slechte toetsen, weet je wel. Uh, er is zo'n, zo'n quote van, uh: every good metric ceases to be a good metric as soon as it's the metric that's optimized of zoiets. Ja, zeker.

16
00:02:28.080 --> 00:02:30.680
Denk ik ook. Het verschil tussen publieke en private benchmarks.

17
00:02:30.740 --> 00:02:41.960
Want die publieke benchmarks, die komen als het ware in de trainingsset terecht omdat er in de dagelijkse- Dat het soms per ongeluk gebeurt omdat gewoon die data erin terechtkomt en daar wordt wel steeds meer iets tegen gedaan.

18
00:02:42.010 --> 00:02:59.380
Maar, nou, in ieder geval, dus die benchmarks die verklaren, uh, weinig en, en, en daardoor kijken steeds vaker mensen gewoon naar, uh, mensen die heel actief de, het veld volgen en heel veel van die modellen zelf geprobeerd hebben en die ze dan zelf uitproberen op de taken waar zij in geïnteresseerd zijn.

19
00:02:59.400 --> 00:03:06.680
En iedereen- Jij bent eigenlijk een soort private benchmarks, toch? Ik bedoel air quotes, benchmarks. Soms, soms. Soms hebben mensen ook echt letterlijk eigen benchmarks.

20
00:03:07.320 --> 00:03:15.060
Uhm, en, uhm, uh, maar het is ook vooral, zeg maar, gewoon dat mensen, eh, even een tijdje het model gebruiken voor hun hoofdtaak.

21
00:03:15.100 --> 00:03:23.480
En vaak is dat, voor veel mensen is dat programmeren met het model en voor anderen is het, zeg maar, het model hangen in een applicatie die ze hebben ontwikkeld die draait op AI-modellen.

22
00:03:24.160 --> 00:03:34.000
En dan wil iedereen weten van, uh, wat zijn de vibes? Weet je wel, hoe, hoe, hoe, wat vinden jullie ervan? Dus een aantal van die mensen, uh, één, één die mensen zouden kunnen kennen van het internet, die heet Swix.

23
00:03:34.100 --> 00:03:43.500
Dat is een, uh, een, een, een soort AI-figuur. En dan heb je ook nog Simon Willison, wat ik echt een geweldige vent vind. Met zijn pelikaan. Met zijn pelikaan inderdaad.

24
00:03:43.680 --> 00:03:53.080
Zijn ultieme test is, voor mensen die het niet weten, is: hoe goed kan een AI-model een pelikaan op een fiets tekenen? Ja, en dan is het ook belangrijk te zeggen, hè, precies met vectoren dus.

25
00:03:53.120 --> 00:04:02.660
Want op zich, er zullen mensen luisteren zeggen: hoezo? We hebben toch een Ghibli-afbeelding en hele films die uit, uh- Belangrijk detail inderdaad. Ja. [lacht] Dus waarom is het nog steeds een goede benchmark?

26
00:04:02.740 --> 00:04:12.200
Omdat hij dat moet doen blind als het ware in, in code. En, en SVG is gewoon een soort HTML. Uh, en, uh, nou, die tests, die worden dus allemaal gedaan.

27
00:04:12.240 --> 00:04:22.000
En daar zag ik dus gisteren al dat, uh, mensen best wel positief waren. Uhm. Ja, want heel even voor de luisteraars misschien. Kijk, wat ik dus merkte: er was best wel een verschil, hè.

28
00:04:22.040 --> 00:04:32.220
Dus je had, uh, oké, uh, best wel een groep mensen die soort van tegenviel, want er was ons toch artificial general intelligence beloofd en GPT-5 zou, uh, nou ja, buitenaards moeten voelen of zo.

29
00:04:32.800 --> 00:04:40.800
En, uh, er is een hele groep die zegt: nee, het is gewoon— zeker de groep trouwens die er al een week mee heeft mogen werken. Of twee weken, hè, want je had een soort van mensen die, uh, achter, uh,

30
00:04:42.469 --> 00:04:49.540
uh, hoe zeg je dat, uh, die moesten even wachten voordat ze erboven mochten praten. Embargo. Embargo. Thanks, man.

31
00:04:49.640 --> 00:04:54.040
Uh, die achter het embargo zaten, waaronder Simon Willison bijvoorbeeld, die volgens mij ook al een tijdje access had.

32
00:04:54.220 --> 00:05:01.120
En de jongens van Every en zo, die hebben allemaal, dropten allemaal rond dezelfde tijd een soort van vibe check van de laatste twee weken GPT-5.

33
00:05:01.860 --> 00:05:11.480
Die groep die er al wat langer mee heeft mogen werken, voelt voor mij een stuk positiever dan de groep die er pas net mee heeft mogen werken of er eigenlijk nog niet heeft mee mogen werken, maar alleen maar een soort vibe check doen.

34
00:05:12.080 --> 00:05:24.080
Zag jij dat ook, of? Ik denk dat dat ook wel logisch te verklaren valt aan de hand van wat het, uh, echt is. Uhm, het is namelijk een model dat op de headlines niet heel indrukwekkend overkomt.

35
00:05:24.120 --> 00:05:34.280
Dus als je kijkt naar een belangrijke benchmark die relatief moeilijk te gamen is, zeg maar, als je hele hoge scores hierop haalt, dan, uh, heb je waarschijnlijk ook wel een nuttig model.

36
00:05:34.320 --> 00:05:43.280
Daarom word-- is het ook een van de betere benchmarks, uh, want het is heel moeilijk om daar soort van heel goed op te scoren en dan in het echt heel nutteloos te zijn. Maar dat is, uh, een test.

37
00:05:43.320 --> 00:05:52.280
Dat heet de SWE-bench en dat is een test die test: hoe goed kan je een, een, een, een, uhm, een fix implementeren voor een bestaand stuk software?

38
00:05:52.340 --> 00:06:00.620
Dus dan heb je een grote bestaande codebase en daar moet er dan iets aan gerepareerd worden en dan moet er getest worden of ook dat ding gefixt is.

39
00:06:00.680 --> 00:06:10.120
En dat zijn dan, uh, dat zijn geloof ik een aantal duizend problemen, maar ze hebben gereduceerd naar een soort schone dataset van 500 van die software engineering tasks.

40
00:06:10.330 --> 00:06:35.008
EnUh, daarop scoorde hij maar, dus GPT-5 scoort maar 0.5% punt beter dan Claude Opus 4.1 en Claude Opus 4, want 4.1 had, uh, Antropiq sneaky gereleased deze week om nog even snel, uh, zeg maar hun plasje erover te doen van: wij zijn er ook en we hebben ook iets, iets, ietsje beter, maar Claude 4 Opus- Het kan zo grote te maken dat ze in de buurt zitten natuurlijk ook, hè.

41
00:06:35.148 --> 00:06:52.308
Ja. Maar Claude Opus 4, wat al langer uit was, die scoorde ook rond de 70, 72% op die, op die benchmark. En Claude Opus 4.1 scoort volgens mij 74,5%, uh, 74.4 en dan, uh, 74.9 voor OpenAI.

42
00:06:52.488 --> 00:07:00.528
Dus het is allemaal heel dicht bij elkaar. En dan denkt iedereen van: zie je, plateau. We zijn, we zijn geplateaud met, uh, de modellen en het wordt allemaal niet beter.

43
00:07:01.208 --> 00:07:14.468
En ik denk dat de belangrijkste of de, de, de, de, de, de verste manier om te karakteriseren wat deze lancering was, is dat het voor OpenAI een soort clean up act was. Ze hadden namelijk een groot probleem.

44
00:07:14.508 --> 00:07:24.578
Ze hadden het probleem van een hele verwarrende modelpicker. Ze hadden zo'n modelpicker waarbij iedereen op 4o zat omdat je denkt: ja, maar er staat ook een 3-model en dat 3-model moet, moet slechter zijn.

45
00:07:24.578 --> 00:07:33.888
Ja, nog los van het feit dat er natuurlijk heel veel, uh, mensen zijn die, uh, ChatGPT, uh, niet betalen, hè, dus die zaten sowieso allemaal met 4o te praten.

46
00:07:33.898 --> 00:07:41.648
Ik heb tijdens heel veel lezingen die ik geef, zeg ik altijd van: ja, ik, waar ik dagelijks mee werk zijn zul-zulke andere modellen als wat veel van jullie dagelijks mee werken.

47
00:07:41.688 --> 00:07:50.768
Als ik dan handen omhoog doe, heb je echt 60% van een groep die op de gratis ChatGPT zit. Ja. Heb ik verder geen oordeel over, maar die hebben helemaal niet eens een idee dat er modellen te kiezen zijn. 100%.

48
00:07:50.808 --> 00:07:54.268
Dus, dus er zijn ook nog mensen die volledig op de, de gratis tier zitten.

49
00:07:54.308 --> 00:08:03.788
En die mensen die zagen niet de echte capability en dus was er een heel groot deel van mensen die ook het idee van: nou, dat AI-ding, dat is helemaal niet zo slim. Ja, dat komt omdat je de domme versie gebruikt.

50
00:08:04.488 --> 00:08:16.548
Uhm, maar dus OpenAI had in ieder geval een probleem van geen, geen eenheid in hun, uh, modellen en een slechte verzameling aan namen sowieso ook. Dus hoe ze het überhaupt noemen, zodat heel verwarrend allemaal is.

51
00:08:16.788 --> 00:08:26.168
Het is ook onpraktisch, want hoofd, uh, hoofdzakelijk hadden ze twee verschillende modellen. Ze hadden een snel normaal model waar ze al eerder mee gekomen waren.

52
00:08:26.248 --> 00:08:38.688
Dat is GPT-4o en dat reageert direct en gebruikt niet veel zoals wat ze noemen test time compute. Dus tijd om na te denken over het geven van het antwoord. Ja, snelle bluf. Snelle bluf. Hopelijk- Gecontroleerde bluf.

53
00:08:38.808 --> 00:08:46.448
Precies. En aan de andere kant had je, uh, hun nieuwste model wat dan alleen betaald toegang had, 3o. En dat is een reasoningmodel.

54
00:08:46.608 --> 00:08:57.708
Dat, daarvoor had je één, 1o, e-én o als model, maar dat ze allebei dezelfde zijn van die reasoningmodellen. En eigenlijk moet je als user telkens kiezen: wil ik dat ie gaat nadenken of wil ik een snel antwoord?

55
00:08:57.948 --> 00:09:06.348
En dat moest je de hele tijd handmatig doen. Nou, dat was voor iedereen natuurlijk best wel gedoe, dus veel mensen gebruikten of de hele tijd het dure model wat, wat nadenkt.

56
00:09:06.728 --> 00:09:11.348
Maar dan moet je dus altijd wachten, ook als je even een simpele e-mailvraag stelt of wat dan ook.

57
00:09:12.028 --> 00:09:21.728
Uhm, en er zijn mensen die proberen nooit dat reasoningmodel, die gebruiken altijd het domme model en die, die hebben dan een soort onderschatting van wat AI kan. En dat moesten ze fixen.

58
00:09:21.768 --> 00:09:32.888
En dus deze release was hoofdzakelijk dat ze dat probleem opgelost hebben door één model te maken wat niet eens echt een model. Het is, het is een systeem en geen model. GPT-5 als model bestaat niet eens.

59
00:09:32.928 --> 00:09:37.228
Het is geen één model. Het is een- Ja, dit is misschien even een belangrijke om bij stil te staan, Rick.

60
00:09:37.268 --> 00:09:50.168
Want in essentie, ze hadden natuurlijk ook kunnen zeggen: we pakken o4, hè, want ze hadden wel o4 miniseries en ik denk o4 gewoon full intern en kunnen zeggen: we gaan door op die branding, hè, dus we stoppen gewoon met die GPT-serie- Ja.

61
00:09:50.268 --> 00:09:58.748
Qua buitenkant en we gaan voor, door op een o4-serie. Ik denk, om eerlijk te zijn, speculatie, dat dit een optie geweest is intern, want die O-series qua branding is best wel lekker.

62
00:09:59.188 --> 00:10:10.648
Hè, dus de modellen van OpenAI zijn o1, o3 en dan nu o4. En dan gaan we zo door vijf, zes, zeven in de toekomst. Nu pakken ze eigenlijk die oude GPT-brand. Ook omdat natuurlijk GPT-5 nog boven de markt hing als het ware.

63
00:10:10.688 --> 00:10:15.628
Dus ik snap ook wel dat ze daar iets moesten zeggen. Maar, en dan, dan, uh, [lacht] hou ik weer even mijn mond.

64
00:10:16.088 --> 00:10:22.408
In essentie hebben wij, zijn we gewend als mensen die hier echt dicht op zitten om, om steeds in modellen te praten, hè.

65
00:10:22.428 --> 00:10:31.828
Dus dan gaan ook die, ja, uh, uhm, online community meteen weer, uh, op die modellen zitten en dan al die modellen vergelijken en die weten zelfs wat die modellen ongeveer doen en zijn.

66
00:10:32.228 --> 00:10:42.048
Terwijl het merendeel van de mainstream GP-GPT of chatgebruikers zoals mensen om me heen het veel noemen. Die hebben helemaal geen idee van modellen, die zijn gewoon met AI aan het praten. Ja.

67
00:10:42.068 --> 00:10:55.108
En ik denk in, in dat opzicht dat wat GPT-5 is inderdaad een soort, ja, product, een, een, een systeem, een stuk software waar, uh, die modellen een onderdeel van zijn. Een hele rits van GPT-5-modellen. Ja.

68
00:10:55.708 --> 00:11:07.748
En wat ze wel zeggen bij het, uh, [schraapt keel] bij de lancering van GPT-5 is dat het systeem wat ze hebben gebouwd dus nu een expliciet systeem is, maar dat ze dat wel willen terugbrengen naar één model.

69
00:11:08.288 --> 00:11:13.088
Maar ze hebben gewoon eigenlijk aangegeven dat ze dat niet hebben kunnen klaarspelen.

70
00:11:13.168 --> 00:11:30.048
Dus het was te moeilijk om nu één model te trainen wat eigenlijk the best of both worlds gebruikt, uh, ge-, uh, kan gebruiken van snel reageren als je snel kunt reageren omdat het probleem niet vraagt om heel veel extra denktijd of heel lang nadenken als dat, als dat nodig is.

71
00:11:30.488 --> 00:11:39.288
En dus wat ze nu gedaan hebben, is ze hebben dus een router geïntroduceerd. En een router is eigenlijk niets anders dat iets wat binnenkomt stuurt ie of naar het één of naar het ander.

72
00:11:39.388 --> 00:11:47.368
Ja, een soort air traffic controller toch? Die weet welke modellen er beschikbaar zijn. Moeilijke vraag. Gaat naar een reasoningmodel o4 in de achtergrond.

73
00:11:47.408 --> 00:11:59.768
Misschien, hebben ze niet gezegd, maar dat zou zomaar het volledige o4-model- Nee, er is wel degelijk gezegd dat op het moment dat je in ieder geval in de free tier, uh, dat als je wat meer gebruik gaat maken van je free tier, dat ze terug kunnen vallen op 4o in de achtergrond.

74
00:12:00.308 --> 00:12:03.258
Zelfs 4o, zeg maar. Dus niet eens de reasoningversies.

75
00:12:03.288 --> 00:12:12.208
Dat er nog een, voor hun nog in ieder geval, die is waarschijnlijk nu lekker goedkoop voor OpenAI om uit te serveren, zelfs een t-terugval is naar een eerdere GPT-serie. Maar goed.

76
00:12:12.648 --> 00:12:24.992
In ieder gevalWat we niet weten is wat er precies met O for, dus niet 4o, maar O for, het reasoning model for, wat de volgende versie zou zijn van O3. Of dat GPT-5 Thinking is genoemd.

77
00:12:25.002 --> 00:12:34.212
Dus als je in die model card gaat kijken, dan zegt hij dus: we kunnen jouw query uitsplitsen naar een model wat ofwel gaat nadenken of niet gaat nadenken.

78
00:12:34.272 --> 00:12:43.312
Maar daarna heb je weer een verta-ver-vertakking en dat is als hij gaat nadenken, hebben we een groot sterk nadenkmodel en een klein, uh, nadenkmodel.

79
00:12:43.772 --> 00:12:51.952
En we hebben ook aan de snelle kant een, een groot snelmodel en een klein snelmodel. En, en dit is allemaal een kostenplaatje.

80
00:12:52.012 --> 00:13:01.412
En als je dan, als je dan kijkt naar wat is nou-- dus, dus aan de ene kant gebruiksgemak van ik hoef niet meer na te denken dat, dat hele sturen naar het juiste model, dat doet het systeem voor me nu.

81
00:13:02.012 --> 00:13:15.452
Maar wat cruciaal belangrijk is, is dat OpenAI heeft dit model geïntroduceerd tegen een extreem aantrekkelijke prijs omdat het competitief is met het beste model van Anthropic, Claude Opus, Claude Opus 4, 4.1.

82
00:13:16.452 --> 00:13:26.052
Maar het is acht keer zo goedkoop in de output tokens en het is zestien keer zo goedkoop in de input tokens. En dit is misschien sowieso wel een, effe een interessant onderscheid, hoor.

83
00:13:26.082 --> 00:13:38.052
Want kijk, jij en ik als, uh, ontwikkelaars, meer techneuten die kijken hiernaar. Toen de lancering van GPT-5 was gisteren en ik daarna een model card was, zag met allerlei losse modellen, dacht ik: wacht even.

84
00:13:38.572 --> 00:13:50.492
Er was ons toch tussen air quotes beloofd dat die air traffic controller, dat die router als het ware in het model meegebakken zou zijn. We zouden een soort supermodel krijgen die zelf dat dan kan beslissen.

85
00:13:50.752 --> 00:13:59.992
Uiteindelijk blijkt dat we als ontwikkelaars, hè, want wij hebben natuurlijk. Kijk, de meeste mensen die hier naar luisteren, die interacteren denk ik vanaf de consumer site.

86
00:14:00.012 --> 00:14:09.212
Dus die zijn gewoon eindgebruiker binnen de, de apps of de website van OpenAI. Waarbij je een model picker had als je op het plusplan zat. Maar over het algemeen was dat wat je deed.

87
00:14:09.322 --> 00:14:16.552
Terwijl wij op de achtergrond natuurlijk veel meer knoppen hebben om aan te draaien en nu ook best wel weer veel knoppen hebben gekregen.

88
00:14:16.572 --> 00:14:25.292
Wat mij dus verbaasde omdat ik dacht, ik dacht even dat wij dat niet meer, dat ik niet meer hoefde te routen. Want weet jij of wij ook toegang hebben tot die router op ontwikkelings? Ja, ja.

89
00:14:25.392 --> 00:14:31.392
En hoe heet hij dan als model? GPT-5. Nou, that's it. En dan gaat hij zelf keuzes maken op de achtergrond. Absoluut. Ah, check.

90
00:14:31.432 --> 00:14:40.172
Dus wat, uh, OpenAI heeft bedacht is dat diezelfde eenvoud van one system, uh, OpenAI vogelt uit waar het heen moet.

91
00:14:40.472 --> 00:14:50.612
Dat het ook wel waardevol kan zijn voor developers die niet al die verschillende controle willen van: ik wil dat hij altijd naar een thinking model gaat, want ik weet dat de mensen mij alleen maar thinking-achtige problemen sturen.

92
00:14:50.872 --> 00:14:54.672
Dus als jij ooit een keer naar een niet thinking model stuurt, dan heb je het waarschijnlijk fout.

93
00:14:54.722 --> 00:15:01.972
Want ik weet dat ik alleen maar thinking vragen stuur en dus die willen dat risico niet lopen dat, dat dat systeem in de weg zit als het ware. Ja.

94
00:15:02.052 --> 00:15:12.372
Op het moment dat het straks echt één model is wat ze dus willen, maar wat niet ge-gereleased is met GPT-5, dan heb je misschien die controle niet meer, uhm, want dan, dan gaat het echt naar één model.

95
00:15:12.412 --> 00:15:15.112
Dus dan moet je maar gewoon hopen dat het model die routing goed doet.

96
00:15:15.672 --> 00:15:34.422
Uhm, alhoewel, je kunt zo'n één model ook vaak wel, uhm, sturen op een wat striktere manier met system prompts en dergelijke waarbij je dan zegt: oké, je moet reasoning gebruiken en dan zal hij dat ook altijd doen omdat je dan kan overrulen dat hij zijn, uh, eigen inschatting moet maken.

97
00:15:34.432 --> 00:15:46.132
En is dat het hele idee van een, van één model iets wat gewoon een soort schoonheid heeft in ons ontwikkelaarshoofd? Of is het daadwerkelijk interessant om dat wel te doen? Het is interessant en de reden is dat er, uhm,

98
00:15:47.192 --> 00:15:56.572
er sommige, sommige problemen, zeg maar classificeren of iets wel of niet veel denkkracht nodig heeft, kan best een subtiel ding zijn.

99
00:15:56.912 --> 00:16:03.692
Dus die routinglaag die er nu is, dat is waarschijnlijk een best wel domme routinglaag. En, uh,

100
00:16:04.632 --> 00:16:17.792
dat beter maken, dat hij dat echt holistischer beoordeelt als het ware, dat vereist waarschijnlijk dat dat gewoon allemaal in één model zit, zodat je dat in zijn geheel kunt trainen. Nu zijn er als het ware losse,

101
00:16:18.892 --> 00:16:24.652
losse modellen, dus losse neural networks, die eigenlijk allemaal hun eigen onafhankelijke weights hebben.

102
00:16:25.072 --> 00:16:34.971
En dan kan je hier de weights veranderen en dan gaat de rest van het systeem bijvoorbeeld blijft statisch en dan moet je weer kijken hoe gaat dit ver-gewijzigde model zich verhouden in het systeem.

103
00:16:35.252 --> 00:16:41.132
Dus vooral voor de evolutie van zo'n systeem, dus als je het beter wil maken, ben je echt whack-a-mole aan het spelen.

104
00:16:41.652 --> 00:16:50.872
Maar is het nu zo dat, uh, bijvoorbeeld, uh, de andere Frontier Labs, uh, DeepMind, uh, Anthropic dit al wel doen? Hebben die al die holistische modellen nu of zijn het ook allemaal nog modellen met routers ervoor?

105
00:16:50.902 --> 00:17:01.652
Nou, goeie vraag, want waar gaat het eigenlijk om? Het gaat er niet eens om dat je meerdere modellen hebt per se. Het gaat erom dat je dynamisch kan bepalen hoe lang je moet nadenken over een vraag.

106
00:17:02.332 --> 00:17:14.452
En wat Anthropic heeft is thinking budget. Dus je kunt een, uh, vraag stellen en je kunt zeggen: denk er heel lang over na. Dan gaat hij bijvoorbeeld 32.000 tokens gebruiken om na te denken.

107
00:17:15.012 --> 00:17:23.352
Of je kan zeggen: denk maar maximaal 1.000 tokens en dan moet het, moet het goed zijn. En, uhm,

108
00:17:24.512 --> 00:17:33.512
dat, dat dynamisch, uh, dat is nog niet helemaal automatisch dynamisch, maar het heeft wel, uh, ingebouwd dat het probeert de gedachte af te ronden in 1.000 tokens.

109
00:17:33.992 --> 00:17:44.532
En dat is wel een interessant verschil, want hij zegt niet van: begin maar met denken en na 1.000 tokens, pop, stop. Hij zegt: denk ongeveer zo lang na en geef dan een antwoord.

110
00:17:45.112 --> 00:17:55.872
En wat je dus, uhm, gaat zien is dat het nog dynamischer wordt, waarbij het niet, uh, gespecificeerd wordt hoeveel tijd budget je hebt, maar gewoon echt puur afhankelijk van wat er binnenkomt wordt bepaald hoe lang er wordt nagedacht.

111
00:17:55.912 --> 00:18:05.472
En dat wordt, dat wordt gewoon actief onderzocht door alle labs. Maar er is niemand die dat echt helemaal live heeft. Dat hele dynamische reasoning, uhm.

112
00:18:05.652 --> 00:18:19.256
Of heb je de open weights, uh, modellen?Experimenten in kleinere modellen of Er zijn misschien wel, uh, echt niet production scale modellen waar dit idee getest wordt van: kunnen we, kunnen we modellen laten bepalen hoe lang ze moeten nadenken?

113
00:18:19.316 --> 00:18:27.116
Ik kan me herinneren dat ik een aantal papers daarover bij voorbij zien komen, uh, maar dat zijn dan vooral experimenten die gebeuren op modellen die echt sub scale zijn.

114
00:18:27.156 --> 00:18:36.896
Dus echt bijvoorbeeld een one billion parameter model wat tegenwoordig heel klein is en die dus eigenlijk alleen maar toy problemen kunnen oplossen. En dat ze dan voor toy problemen kunnen laten zien.

115
00:18:36.936 --> 00:18:46.176
Ja, het model kan bepalen of die moest nadenken of niet, maar de vraag is natuurlijk altijd generaliseert dat als je naar die grote schaal teruggaat waar deze modellen in opereren, zoals een GPT-5.

116
00:18:46.896 --> 00:18:52.906
Dat is dan even een paar stappen terug nemen, hè, want ik begon net een beetje over twee kampen te praten. De AGI-kamp die zegt: het valt allemaal tegen.

117
00:18:52.956 --> 00:19:02.856
Er is ons, uh, buitenaardse technologie beloofd en aan de andere kant mensen die het al hebben mogen testen vaak en een stuk genuanceerder zijn en zeggen van: joh, er is hier heel veel tegelijk aan de hand.

118
00:19:03.256 --> 00:19:09.636
Een van die punten is dat het een soort refactor is, hè, binnen OpenAI. Want voor de, voor de luisteraars ChatGPT was een experiment.

119
00:19:09.676 --> 00:19:17.816
Het heette namelijk Chat with GPT, begreep ik gisteren uit de, uit de presentatie en iets wat ze online gegooid hebben. Toen ontplofte dat gewoon helemaal niet normaal.

120
00:19:18.236 --> 00:19:22.476
En dan moet je natuurlijk, zoals het met softwareontwikkeling gaat, eigenlijk je fiets repareren terwijl je erop zit.

121
00:19:22.496 --> 00:19:31.076
Of in ieder geval je fiets repareren en nieuwe dingen opdoen, terwijl die persoon die erop zit moet blijven fietsen. En dan krijg je dus hele rare wildgroei en technical debt, zoals dat dan heet.

122
00:19:31.216 --> 00:19:42.936
Een soort, uhm, ja lening die je hebt, uh, naar je verleden omdat je zoveel, uh, uh, troep hebt opgebouwd en je kon niet door. Ja, en dit is eigenlijk een soort, voelt als een soort refactor dus, hè.

123
00:19:42.996 --> 00:19:51.016
Dus GPT-5 is een soort schone lei. Het opruimen van eerdere keuzes die zijn gemaakt uit pure, uh, uh, ja, on- of niet, onkunde is het verkeerde woord.

124
00:19:51.056 --> 00:20:01.616
Het kon gewoon niet anders, want je wil doorgroeien en je wil ook op nummer één blijven als OpenAI. Dus dat ze dit terwijl ze zo hard groeien en zoveel gebruikers hebben in situ doen is best wel bruut.

125
00:20:02.136 --> 00:20:13.836
Uh, maar eigenlijk los van die, van die, uh, soort consolideren en, en opschoonactie is er wel veel meer aan de hand. Uh, ik bedoel, ik weet niet of jij hebt gevolgd wat er met, uh, METER is gebeurd.

126
00:20:13.876 --> 00:20:18.936
De benchmark die kijkt hoe lang een model, uh, zonder ingrijpen, uh, door kan werken.

127
00:20:19.236 --> 00:20:30.276
Dit was een van de eerste waar ik naartoe ging omdat Project 2027, wat, hè, de luisteraars weten dit nog uit een AGI-aflevering, de, het scenario, uh, dat alles, uh, in 2027 al heel anders zou zijn.

128
00:20:30.316 --> 00:20:39.476
Want er zit allerlei exponentiële groei in deze modellen en AGI, Artificial General Intelligence, komt veel sneller. Een van de, uhm, ja, uh, hoe zeg je dat?

129
00:20:39.896 --> 00:20:53.656
Benchmarks of, of harde cijfers die in de gaten gehouden wordt in dat scenario van Project 2027 is het idee: hoe lang kan zo'n agent of in ieder geval model agentic model, uh, werken zonder dat wij hoeven ingrijpen?

130
00:20:53.956 --> 00:21:05.416
En daarin is GPT-5 begreep ik best wel gestegen. Ja, ik denk dat, dit is een goed bruggetje naar denk ik de tweede andere grote observatie van de lancering dus. Tuurlijk, het is een model routed systeem.

131
00:21:06.056 --> 00:21:16.016
Uh, dat is, dat is nieuw. Het lost een aantal technical debt problemen op voor OpenAI. Daarom is het voor hen belangrijk. Door model routing is het goedkoop. Dat is allemaal, uh, één deel van de lancering.

132
00:21:16.196 --> 00:21:24.156
Ander deel van de lancering is dat het een heel agentic model is. En als je het hebt over: wat betekent dat dan, agentic? Agents, iedereen heeft het daar over.

133
00:21:24.196 --> 00:21:40.676
Maar, uh, ik denk dat de meeste mensen die het model agentic noemen, die, die daarmee bedoelen dat het heel goed is in, op een, uh, uh, over een lange tijdshorizon, dus misschien dat het 10, 20, 30, 40 minuten bezig is, dat die continu een, een handeling verricht.

134
00:21:40.696 --> 00:21:50.956
En dat is wat je dan in jargon een toolcall noemt. En dat kan zijn even een stukje extra informatie van de GitHub, uh, repository lezen over het project waar het mee bezig is.

135
00:21:50.996 --> 00:22:00.816
Of even iets zoeken in de documentatie op het publieke internet. Of even een klein stukje code schrijven, uitvoeren, observeren en daar weer op verder itereren.

136
00:22:00.896 --> 00:22:05.276
Dat soort handelingen verrichten en dat dan over een langere tijdshorizon.

137
00:22:05.766 --> 00:22:17.876
Dat is iets waar dit model extreem goed in is en dat was in het verleden best goed in GPT-4o, maar dat was nog niet zo'n reasoning model en het was veel minder goed in die reasoning modellen, o3.

138
00:22:18.616 --> 00:22:26.416
En als je, uh, praktische software aan het schrijven bent, dan gaat het heel erg over dat iteratief ontdekken waar je denkfout zit.

139
00:22:26.536 --> 00:22:35.336
Dus als je denkt: oh, ik moet de code zo schrijven, dan moet je dat even, even proberen en dan kan je het runnen en dan kan je observeren en dan kan je weer iets leren.

140
00:22:35.356 --> 00:22:47.586
Dus het is die progressieve, uh, soort van informatievergaring en dat autonoom doen zonder wat ze noemen in een doom loop te komen. Waarin je dus vastloopt omdat je de hele tijd dezelfde fouten maakt.

141
00:22:47.616 --> 00:22:54.356
Of je probeert de hele tijd iets op een manier te doen die gewoon fundamenteel niet klopt, maar je blijft toch telkens weer die richting op gaan.

142
00:22:54.536 --> 00:23:01.416
Dat, uh, goed doen, dat maakt die, die modellen vooral heel veel meer waardevol, omdat je makkelijker kunt delegeren, want ze lopen niet vast.

143
00:23:01.836 --> 00:23:28.056
Dus ze kunnen ook- En wat ik, wat ik bijvoorbeeld zag in die METER, dat is dus die benchmark om te kijken, uh, hoe lang houdt zo'n model het vol zonder dat hij of vast komt, vast komt te zitten of opgeeft, zeg maar, of beide, is dat ik wel interessant vond dat bijvoorbeeld Claude, uh, uh, Opus 4.1, uh, doet eigenlijk een plan maken, uh, nadenken, een zwik aan toolcalls achter elkaar, 10 toolcalls, dan nog een keer nadenken en dan antwoord geven.

144
00:23:28.416 --> 00:23:38.066
Terwijl GPT-5 doet, uh, plan maken, nadenken, toolcall, weer nadenken, toolcall, weer nadenken, o-- terug, nieuw plan maken, weer nadenken, nieuwe toolcall.

145
00:23:38.376 --> 00:23:49.016
En kan dus eigenlijk zonder dat in die volgorde te doen echt iteratief stap voor stap zelf ook merken, want in een van die, uh, reasoning, uh, traces stond ook: ik zit in een doom loop.

146
00:23:49.336 --> 00:23:56.416
[lacht] Dat is helemaal, dus best wel knap dat je kan herkennen dat je vastloopt. Heel meta, ja, ja. Soort halting problem. Meta reasoning.

147
00:23:56.576 --> 00:24:05.726
Ja, dat is best wel heel knap, want hij op een gegeven moment zei— en [schraapt keel] daarin zag ik wel dat ik dacht: ik wilde natuurlijk weten hoe komt het nou dat GPT-5 het langer volhoudt?

148
00:24:05.756 --> 00:24:10.256
Daarvoor moet je dus dit soort innovaties doen. Ja, en daar is reasoning echt belangrijk voor.

149
00:24:10.336 --> 00:24:21.840
Want wat reasoning, uh, toelaat is een stukje reflectie waarbij het, uh-Kan redeneren over wat er tot nu toe is gebeurd in het proces, in zo'n roll-out zoals je zou kunnen noemen.

150
00:24:22.500 --> 00:24:37.500
En, uh, echt daar een soort, uhm, een, een soort, uh, strip in het zand zet en zegt: of een line in the sand, I don't know, uhm, waarbij je dan, uh, concludeert: dit gaan we niet doen, we gaan iets anders doen.

151
00:24:37.540 --> 00:24:55.500
En door dat met hele felle woorden te zeggen, en dat is grappig hoe die LLM's werken, die moeten dat soort, uh, s-, uh, stick in the ground, zeg maar, stake in the ground, uh, markers achterlaten, zodat dan verder als ie doorgaat, dat echt in z'n geheugen blijft.

152
00:24:55.540 --> 00:25:01.480
Soort van: dat ga ik echt niet meer doen, want dat ga ik doen. Ja, en je kunt het ook echt lezen in die reasoning traces.

153
00:25:01.640 --> 00:25:14.860
Dat dus dat soort, ja, krui-kruimels, markers, whatever, achtergelaten worden in zijn eigen context window die die zelf natuurlijk aan het bijvullen is om te zorgen van: daar, daar moet je gewoon echt niet meer nog een keer over na gaan denken, weet je wel.

154
00:25:15.430 --> 00:25:16.320
[lacht] Trust me.

155
00:25:16.360 --> 00:25:38.340
Dat zorgt er dan voor uiteindelijk dat, en of dat nou helemaal causaal is of dat het gewoon een, een, een, een artefact is van hoe het geïmplementeerd is met attention en hoe die transformer architectuur werkt, dat, dat is lastig te zeggen, maar het is in ieder geval duidelijk te observeren in die roll-out dat dat gebeurt en dat ie daar, uhm, continu in staat is om echt wel een, een exploratie te doen.

156
00:25:38.380 --> 00:25:46.600
En daarom ook, uh, zo grappig, er zijn allemaal academische conferenties over machine learning en dan hoor je waar ze het over hebben.

157
00:25:46.620 --> 00:25:51.799
En dat is wel een beetje wat in de kraamkamer ook van de Frontier Labs besproken wordt en aandacht voor is.

158
00:25:52.340 --> 00:26:03.700
Uhm, en een van de belangrijke topics was reinforcement learning exploration en, uh, dat gaat over, over het idee, reinforcement learning is een techniek die gebruikt wordt om dit soort modellen te bouwen.

159
00:26:04.100 --> 00:26:15.860
Maar het exploratie verhaal, dat gaat erom van: hoe kun je nou zorgen dat als zo'n model autonoom te werk gaat, dat het heel efficiënt, uhm, een, een soort mogelijke oplossingen gaat verkennen.

160
00:26:16.280 --> 00:26:22.260
Dus het moet niet te veel indexen op: ik denk dat het zo moet en ik ga dat proberen en als het niet lukt gooi ik mijn handen omhoog.

161
00:26:22.600 --> 00:26:34.480
Het moet eigenlijk heel efficiënt in staat zijn om een soort impliciete, uh, lijst te creëren van ideeën en die continu te re-ranken. En dat op het moment dat ie iets gaat proberen dat ie het juiste idee gaat proberen.

162
00:26:34.520 --> 00:26:46.820
En op het moment dat ie dat daar wat van leert omdat het of niet werkt of half werkt, dat ie daar dan weer op basis daarvan de exploration weer, weer, weer goed, goed afstelt, herkalibreert en doorgaat.

163
00:26:47.040 --> 00:26:59.980
En dat, dat is, ja, is toch wel een beetje, uh, dat gaat wel neigen naar general intelligence. Uhm, en, want dat is toch hoe je heel veel problemen als mens ook, uh, oplost en, en da-daar zie je dus hints van.

164
00:27:00.440 --> 00:27:09.460
En ik denk dat het feit dat het dus in een, één systeem zo agentic is gemaakt, dat, dat merk je vooral als je ermee gaat programmeren. Uhm.

165
00:27:09.500 --> 00:27:14.240
Ja, dat is natuurlijk ook wel een boeiende, hè, dat ze- Dan zie je het gewoon heel erg. Ja, want je hebt natuurlijk de benchmarks.

166
00:27:14.280 --> 00:27:20.140
Nou goed, die benchmarks halen ze zelf ook tijdens hun presentatie aan, dus dan gooi je een beetje je eigen glazen in, want dan worden die, hè.

167
00:27:20.420 --> 00:27:24.800
En je vergelijken alleen met eigen eerdere modellen, daar worden mensen dan ook een beetje zenuwachtig van.

168
00:27:25.200 --> 00:27:35.720
In dat opzicht, uh, hielp dat, zeg maar, niet voor het eerste verhaal net na de lancering, hè, van iedereen ging met de procenten gooien en procentpunten die er tussen de verschillende benchmarks zaten.

169
00:27:35.800 --> 00:27:47.460
Terwijl waar ik dan net als jij, ik ga meteen op X en op andere, uh, platforms zoeken naar al die ontwikkelaars die in hun achterzak een bepaalde, ja, noem het de de facto benchmark hebben zitten.

170
00:27:47.750 --> 00:27:57.820
Wat ik bijvoorbeeld heel veel zie is dat er mensen zijn met oude codebases, hè, een jaar of zeven of acht oud, met daarin een onoplosbaar ding. Het is ze zelf nog nooit gelukt en/of ze hebben er geen tijd voor.

171
00:27:58.280 --> 00:28:10.340
En die gooien dat ding gewoon iedere keer tegen die modellen aan. Dus, ja, en daarin las ik dus heel veel die zeiden: finally, het is gewoon gelukt. Ik heb hier iets wat in het verleden al die agents op vastliepen.

172
00:28:10.420 --> 00:28:16.420
Of modellen/agentic models, hè, ook de, uh, 4.1 vanuit Anthropic kwam er niet door.

173
00:28:16.900 --> 00:28:27.180
En het lukt dan GPT-5 door te blijven proberen, te blijven exploreren, uh, iedere keer een stap terug te doen en te zeggen: oké, ik ben dat pad ingegaan, ik ga het pad weer uit, want het heeft geen zin.

174
00:28:27.240 --> 00:28:31.560
Ik ga toch weer een ander pad in. Dat, dat blijven proberen zonder vast te lopen.

175
00:28:31.720 --> 00:28:39.400
Als jij het maar genoeg tijd geeft en er misschien wel vier tegelijk aan zet, hè, dat is natuurlijk allang een oplossing gebleken, dat ie er nu doorheen bijt.

176
00:28:39.800 --> 00:28:48.960
En ik vind dat wel, uhm, ja, prima dat die benchmarks er zijn. En ik zal die benchmarks ook altijd in de gaten blijven houden, want er zitten natuurlijk ook benchmarks bij die minder makkelijk te gamen zijn, hè.

177
00:28:49.620 --> 00:28:57.200
Omdat ze zo breed zijn dat als je die hele benchmark wil kunnen faken, dan ben je gewoon iets wat slim is. Zoals de benchmark: verdien $1 miljoen met je eigen business.

178
00:28:57.260 --> 00:29:04.960
Ik bedoel, als je die kan faken, helemaal prima, zolang het maar legaal is. Dan kan jij andere dingen ook, weet je wel. Dus, dus, uh, dat, dat, ja, die, die helpen dan.

179
00:29:05.320 --> 00:29:14.500
Maar ik, het is minimaal zo interessant om te kijken. Ik heb hier gewoon een probleem in de kast liggen en dat trek ik gewoon iedere keer weer uit de kast en dan vraag ik gewoon weer dezelfde vraag: solve deze bug.

180
00:29:14.540 --> 00:29:25.720
En dan zie je dus als je hem tijd geeft en want daar gaat het uiteindelijk wel om, hè. Het is natuurlijk heel veel compute wat je geeft, uh, na trainen en die, uh, uh, modellen toch er doorheen weten te bijten.

181
00:29:25.740 --> 00:29:35.540
Dat vind ik wel een vette hier. Ja, en het is dus en dat hij dat beter doet, maar ook dat ie, uh, tegelijkertijd dus veel goedkoper is, zodat je ook niet je heel erg druk hoeft te maken.

182
00:29:35.580 --> 00:29:45.220
Want met Claude Opus, ik zweer, als je gewoon een kleine codesessie doet zit je zo aan $20 en dan denk je: nou, ik heb maar, ik heb maar een kwartiertje lopen programmeren en nu ben ik al $20.

183
00:29:45.260 --> 00:29:52.900
Nou oké, dan moet je wel je uurtarief verhogen. Dus zeg maar de, de, de kosten zijn ook echt wel belangrijk in dit soort, uh, scenario's.

184
00:29:53.420 --> 00:30:04.840
Ik wil nog een ander ding, belangrijk ding van de release highlighten wat, wat misschien een beetje, uh, ondergesneeuwd kan worden, maar waar, waar, waarvan ik denk: dat is echt een heel belangrijk resultaat.

185
00:30:05.380 --> 00:30:15.100
En dat is, uh, de lagere hallucination rate. Dus, uh, het, het, uh, hallucinations wordt door, niet door iedereen op dezelfde manier gedefinieerd.

186
00:30:15.600 --> 00:30:29.740
Maar ik, uh, ik kwam een, uh, Twitterpoll tegen en daar was ik het heel erg mee eens met de definitie is dat als er feiten verzonnen wordenDus als er gewoon feiten naar voren komen van in deze code en dan geeft hij een naam van een functie die niet bestaat.

187
00:30:30.220 --> 00:30:42.160
Dus echt gewoon iets feitelijks, verifieerbaar, gewoon incorrect. Ja, het is een, uh, zeer gevaarlijke bluf die met volledige overtuiging aan jou verteld wordt als feit. Stond er maar bij: ik bluf, dat zou helpen.

188
00:30:42.340 --> 00:30:56.040
Dat staat er niet bij. Precies. En het staat er dan niet bij. En op belangrijke benchmarks zie je dat de hallucination rate ge-ge-gedeeld is door vijf. Dus hij, hij hallucineert significant minder.

189
00:30:56.080 --> 00:31:00.720
Dus waar die eerst 5% van de scenario's in een benchmark nu nog maar rond de 1% of lager.

190
00:31:01.540 --> 00:31:12.880
En dat is heel belangrijk, want het gaat gepaard met nog iets en dat is dat die context window van die modellen is hoeveel, hoeveel kunnen ze tegelijk in overweging nemen, is ook opgehoogd van 200k naar 400k.

191
00:31:13.680 --> 00:31:26.020
En wat ze ook nog eens hebben laten zien is dat de, de stabiliteit van het model, dus dat die, dat die, uh, waarheidsgetrouw blijft, uh, veel beter standhoudt tot aan het hele grenspunt van die 400.000 tokens.

192
00:31:26.220 --> 00:31:36.520
Dit is een beetje een, een, uh, een punt wat veel vergeten wordt of, of niet begrepen omdat het ook, het is allemaal hartstikke nieuw en vrij complex. Hè, dat er dan wordt gezegd er is een grotere context window, hè.

193
00:31:36.600 --> 00:31:44.419
Dus ik zeg altijd: je kan er meer boeken in plakken dan dat je gewend was. Je kan meer meesturen met je vraag, meer bijlagen bijvoegen bij je vraag dan dat je voorheen kon.

194
00:31:44.880 --> 00:31:47.800
Maar het is leuk dat jij zoveel ruimte hebt om je bijlage toe te voegen.

195
00:31:47.840 --> 00:31:58.320
Maar als die bijlagen daarna amper bekeken worden en eigenlijk niet meegenomen worden in de deliberation, dan heb je eigenlijk een soort, ja, kartonnen of, uh, piepschuim context window.

196
00:31:58.360 --> 00:32:05.240
Dat is meer een belofte op een spec sheet dan een daadwerkelijk werkende context window. Daar heb je natuurlijk trainingen voor, hè, dat je zo'n needle in a haystack doet.

197
00:32:05.280 --> 00:32:11.340
Dus dan stop je eigenlijk een heel klein feitje ergens in die hele grote bijlage en dan vraag je specifiek dat feitje terug.

198
00:32:11.640 --> 00:32:21.560
En dan blijkt inderdaad dat veel modellen met grote context windows tussen aanhalingstekens eigenlijk niet de aandacht hebben om dat hele context window daadwerkelijk mee te nemen. En deze heeft het dus eigenlijk wel.

199
00:32:21.640 --> 00:32:33.260
Tot in ieder geval 256k begreep ik. 400k. Ja? O, ja, daar, vanaf daar ging die een beetje naar beneden. Dus die degradeert zeker wel, uh, voorbij een bepaald punt, maar het blijft echt best wel hoog.

200
00:32:33.300 --> 00:32:39.600
En er zijn verschillende benchmarks die dat meten. Ik vind trouwens needle in a haystack een hele slechte benchmark, want dat is gewoon retrieval.

201
00:32:40.000 --> 00:32:45.900
Dat is gewoon: kan ik een vraag beantwoorden die direct terug te vinden is ergens in de context.

202
00:32:46.190 --> 00:32:57.200
Maar wat veel lastiger is dan dat, dat, dat kan je namelijk bereiken met een aantal hele efficiënte architecturen, waardoor je tot hele lange context windows kunt voor het retrieval gedeelte.

203
00:32:57.580 --> 00:33:05.700
Maar als jij informatie moet combineren die op meerdere plekken staat diep in het context window. Dus er zijn drie of vier feitjes die gezamenlijk een antwoord kunnen vormen.

204
00:33:05.709 --> 00:33:14.880
A thousand needles in a haystack en die moet je met elkaar vergelijken en daar een- En daar een antwoord op geven. Dat is moeilijk en, en, en dat is waarom attention ook zo duur is.

205
00:33:14.920 --> 00:33:24.240
Waarom die context window zo moeilijk lang te maken is. Omdat als je alles met alles moet vergelijken, dan heb je een kwadratisch probleem en dat betekent dat het heel duur is in memory en in compute.

206
00:33:24.560 --> 00:33:35.260
Ja, want jouw vraag in het datacenter letterlijk houdt gewoon chips bezet. Toch? Die een ander op dat moment niet mag gebruiken. En hoeveel chips het bezet houdt is afhankelijk van hoe zwaar het is om te berekenen.

207
00:33:35.320 --> 00:33:46.190
En dat gaat omhoog, zeer omhoog met de context window. Dus dat we zomaar 400k hebben als context window, dat is, uh, wel significant. Je springt van hallucineren naar context window.

208
00:33:46.300 --> 00:33:50.200
Allebei belangrijk, maar even terugkomend op het hallucineren, want dit is natuurlijk de grote,

209
00:33:51.160 --> 00:34:01.680
uh, in ieder geval bij de, uh, hoe zeg je dat, de gemiddelde gebruiker van AI systemen die ik spreek [lacht] even zo gezegd, is dat hallucineer ding gewoon een beetje onder het volk.

210
00:34:01.740 --> 00:34:11.940
De burgers, de burgerij die zeggen van: ja, daardoor vertrouw ik gewoon het hele systeem niet. Terecht, hè. En daarom highlight OpenAI in hun lancering ook de use cases legal en healthcare.

211
00:34:12.040 --> 00:34:27.160
Want op het moment dat jij vragen gaat stellen aan ChatGPT, ze hadden tijdens de demo een, een patiënt die geneesheers, die een hele moeilijke beslissing moest maken in een genezingstraject en, en die gebruiken ChatGPT om geïnformeerd te zijn.

212
00:34:27.200 --> 00:34:38.340
Dus ja, hallucinaties in dat soort situaties zijn desastreus. Dus het was een van de bijna existentieel problemen voor OpenAI om op te lossen als ze dat niet onder controle krijgen.

213
00:34:38.420 --> 00:34:41.160
En daar hebben ze, daar hebben ze dus gewoon een hele grote sprong in gemaakt.

214
00:34:41.200 --> 00:34:53.120
En wat je ook ziet is dat omdat er heel veel, uhm, datapartnerships gaan, dit is meer ChatGPT als gebruiker, uh, wordt er heel veel informatie ingetrokken om jouw vraag te beantwoorden.

215
00:34:53.160 --> 00:35:01.300
Heel veel super recente actuele informatie. Informatie die een paar minuten geleden pas op het internet gepubliceerd is, kunnen ze al integreren in, in het antwoord.

216
00:35:01.780 --> 00:35:10.060
Maar het is dus nu ook heel feitelijk accuraat op al die externe informatie. En dat is toch een van de grote killer use cases van ChatGPT is dat het gewoon Google overneemt.

217
00:35:10.100 --> 00:35:21.510
En dat is natuurlijk ook de hele lucratieve positie, uh, die OpenAI in, uh, kan nemen. En- Is het in dat opzicht niet sowieso, hoor, even uitzoomen, maar wat ik ook een beetje voel. Ik heb een beetje echo's van,

218
00:35:22.560 --> 00:35:31.980
ik draai ook alweer een tijdje mee in die hele, uh, tech wereld. Releases, keynotes en, uh, samen chippies eten om 7.00 uur, want er komt iets vets, weet je wel. Dat was vroeger natuurlijk de Apple keynotes.

219
00:35:32.080 --> 00:35:41.800
Dat zijn nu een beetje de OpenAI, uh, presentaties voor mij geworden. Uhm, maar toen, het was heel erg spec driven toen al, hè, dus in de tijd even echt lang geleden zeg maar.

220
00:35:41.840 --> 00:35:49.540
Dan ging het over: oh, zoveel hertz heeft het scherm of zoveel megapixels heeft de nieuwe iPhone of zoveel giga interne, uh, zoveel werkgeheugen heeft de iPhone.

221
00:35:49.660 --> 00:35:57.640
Dat is dan in het geval van Apple altijd te weinig werkgeheugen, te oude camera's, displays die Samsung al twee jaar heeft als ze niet zelfs door Samsung gemaakt worden.

222
00:35:57.660 --> 00:36:08.680
Dus ik heb, ik ben altijd heel erg gewend om, je hebt de release van nieuwe Apple producten waarin, uh, ja, de nur- de spec nerds zeg maar, waar ik deels ook onder val, prima, uh, ontevreden zijn.

223
00:36:08.700 --> 00:36:16.372
Hè, want het zijn soort van la- vorig jaar specs in een model, uh, apparaat wat nog duurder geworden is zeg maar. Aha.En ik voor mij.

224
00:36:16.392 --> 00:36:27.052
Ik heb een beetje een soort zelfde, uh, sfeer bij deze OpenAI, uh, bij GPT-5 dat ik denk het voelt veel meer als een soort, uh, eindgebruiker consumentending, hè.

225
00:36:27.112 --> 00:36:40.372
Dus dat ze gewoon hebben gevraagd eigenlijk waarschijnlijk in panels en kijken in hun userdata hoe het gebruikt wordt van oké, het wordt, uh, veel gebruikt voor, uh, medische doeleinden, het wordt veel gebruikt voor schrijven en het wordt veel gebruikt voor programmeren.

226
00:36:40.432 --> 00:36:47.512
Dus die drie gaan we keihard op inzetten. Uh, daarnaast zien we dat hallucineren voor mensen een, uh, probleem is. Gaan we ook op inzetten.

227
00:36:47.611 --> 00:36:53.572
Uh, prijs is een probleem, want we kunnen niet meer goed concurreren in de markt met Gemini's en de Clouds. Oké, gaan we ook aan werken.

228
00:36:53.652 --> 00:37:01.312
Uh, er is verpa-ver-verwarring over modellen, dus mensen willen eigenlijk die modellen niet kiezen. Dat hele reasoning en non-reasoning is te complex. Oké, gaan we ook weg abstraheren.

229
00:37:01.712 --> 00:37:14.871
Het voelt voor mij eigenlijk iets heel erg wat gedreven is door hele, ja, soort boerenverstand, marktinzichten en niet door de model connoisseurs die vragen, uh, nou ja, snap je, die op het pek zitten van wat is dat model?

230
00:37:15.372 --> 00:37:25.272
Ik vind dit, dit gewoon, dit is de karakterisering van de release, want het laat gewoon zien dat OpenAI echt een productbedrijf is, uh, i-in een vrij volwassen fase.

231
00:37:25.332 --> 00:37:34.112
En dat, dat is ook wel logisch te rijmen met het feit dat ze giga groot zijn. Ze hebben bijvoorbeeld maar 700 miljoen actieve gebruikers, wat echt een gigantische grote groep is.

232
00:37:34.152 --> 00:37:44.822
En ook in deze release hadden ze continu over free. Dus de free tier zijn ze de hele tijd aan het uitbreiden en dat laat ook wel zien dat ze, ze, ze gaan gewoon voor de 2 miljard gebruikers, weet je wel.

233
00:37:45.052 --> 00:37:53.331
Ze willen zo snel mogelijk naar dat punt. Ze willen echt die consumermarkt helemaal veroveren en ik denk dat ze dat met de focus die ze hebben goed doen.

234
00:37:53.932 --> 00:38:05.212
Uhm, en wat je tegelijk ziet is wat, wat de specs sheet nerds als het ware, waar ik mezelf ook zeker onder reken- Zeker. Uh, op hopen is glimpses of AGI. Full reasoning, all right.

235
00:38:05.332 --> 00:38:18.052
En, uh, ze hebben met zo'n project wat ze laatst gedaan hebben, dat is wel een grappige context, is dat je hebt een, een, een International Math Olympiad, uh, de IMO, en daar hebben ze aan geparticipeerd na-- samen met, uh, Google

236
00:38:19.032 --> 00:38:24.292
om te laten zien hoe slim die modellen kunnen zijn in het limiet en dat ze dat soort problemen op kunnen lossen.

237
00:38:24.812 --> 00:38:31.512
En er zijn best wel veel mensen, ook echt specialisten, wiskundigen en, en, en ook mensen die echt alleen puur op die modellen focussen.

238
00:38:31.552 --> 00:38:37.132
Machine learning specialisten en dergelijke, die vonden dat dat best wel een, een, een sick resultaat was wat ze daar hadden gedaan.

239
00:38:37.172 --> 00:38:43.852
Ze hadden namelijk de gold medal gewonnen door vijf van de zes problemen van zo'n nooit gelekte test.

240
00:38:43.912 --> 00:38:55.352
Echt een unieke nieuwe test die niemand weet, uh, hadden ze gegeven aan die modellen, hadden ze opgelost en OpenAI heeft daar ook goed gescoord. En ze hebben ook toen gezegd: dit komt niet in GPT-5.

241
00:38:56.632 --> 00:39:06.232
En het is dus heel duidelijk dat ze een bepaalde capability hebben om bepaalde top tier intelligence te produceren intern en ook zelfs te, te testen publiek.

242
00:39:06.272 --> 00:39:12.512
Dat ze daar ook open over communiceren, dat ze dat behalen, maar helemaal niet dat niveau per se willen, w-willen deployen.

243
00:39:12.552 --> 00:39:21.252
Ja, je kunt het, je kunt het ook een beetje vergelijken met ik weet als bijvoorbeeld bij Meta, uh, als ze dan twee keer 16K displays hebben, hè, dus mini OLED 16K displays.

244
00:39:21.292 --> 00:39:33.092
Die laten ze waarschijnlijk op maat maken ergens in China. Ieder display is een ton per oog. Ja, daar hang je dan een datacenter aan GPU's achter om, uh, op 120, hè, fps twee 16K displays aan te sturen.

245
00:39:33.132 --> 00:39:39.672
Die bril, die hang je aan een touw aan het plafond, want anders breek je je nek, zo zwaar is die bril. Nou dan, nee, maar ik bedoel, dat heb je in je lab allemaal staan, hè.

246
00:39:39.712 --> 00:39:47.212
Dus je be-je bent een paar miljoen verder al met de setup. Dat doe je dan bij iemand op, die laat je rondlopen in VR en die zegt dan: wauw, VR is the future!

247
00:39:47.752 --> 00:39:58.632
Alleen van dat punt van een goede lab demo, hè, die je met, met miljoenen hebt moeten maken komen naar een consumer product wat je breed uit kan rollen, daar kan gewoon acht tot tien jaar tussen zitten.

248
00:39:59.172 --> 00:40:03.112
Maar je kunt dan al wel, uh, zeggen: joh, ik heb het gezien, hè.

249
00:40:03.192 --> 00:40:21.152
Dus ik denk ik, ik, ik kan me goed voorstellen dat als jij [slikt] wat wij bijvoorbeeld bij die Math Olympiad nu hebben gezien, hè, als, als buitenstaander, dat je eigenlijk al te zien krijgt: joh, als we, als we 20 keer zoveel compute zouden hebben, uh, en, uh, dat zou betaalbaar zijn, hè, want het is nu gewoon niet betaalbaar om zo'n model uit te rollen.

250
00:40:21.592 --> 00:40:31.582
Los daarvan kan ik me wel voorstellen, even side, uh, sidenote, dat OpenAI richting de $2.000, uh, subscriptions gaat en die ze gewoon aan bedrijven gaan aanbieden. Misschien wel $20.000 per maand.

251
00:40:31.692 --> 00:40:41.532
Je krijgt denk ik dan een beetje dat Apple Vision Pro verhaal waarbij er dan gewoon geen markt is voor het product omdat het gewoon zo duur is dat er maar een heel select aantal mensen dat nog waard vindt.

252
00:40:42.072 --> 00:40:56.892
En dus gaat het heel erg nu o-in de markt en bij dit soort releases over w-hoe ziet de, de, de, de aantrekkelijke variant die economisch uit kan, op schaal kan deployen, hoe ziet dat product eruit en wat zijn daar de scores van?

253
00:40:57.412 --> 00:41:10.632
En ik denk dat de-- dus als mensen zeggen: oh, die curves zijn flat en de, de, de scores zijn niet beter, dan is het denk ik veel meer van: dit is wat ze op een aantrekkelijk prijspunt kunnen produceren en heel breed uit kunnen rollen.

254
00:41:10.692 --> 00:41:14.352
En dit is niet hun maximale wat ze ook maar intern kunnen produceren.

255
00:41:14.472 --> 00:41:29.772
Ze hebben misschien waarschijnlijk een setup die op die benchmark waar ze nu 75% scoren misschien wel 85% scoren, maar dat gaan ze niet aanbieden als product, want er is gewoon te weinig vraag naar een model wat misschien $10.000 per week kost om net even die 10% te krijgen.

256
00:41:29.812 --> 00:41:34.252
Dus da-dan zit je toch in het spel van diminishing returns en wat kan je naar de markt brengen.

257
00:41:34.812 --> 00:41:48.412
En als we dan even advocaat van de duivel spelen richting ons eigen argument nu, hè, want, uh, er zullen mensen die luisteren zijn zeggen: oké, Wytse en Rick, uh, GPT-5 apologists die zeggen dat er nog een geheime techniek binnen OpenAI beschikbaar is waarbinnen A-AGI dichterbij is.

258
00:41:48.912 --> 00:41:59.232
Uh, bijvoorbeeld, uh, de, uh, het is het Arc, uh, 2 Challenge, uh, hè, de, de, de, de van, uhm, CoLette die, uh, AGI-achtige test doet, hè.

259
00:41:59.352 --> 00:42:09.692
Arc 1 is dan, uh, saturated en Arc 2, uh, zit op, uh, ik weet het niet eens uit mijn hoofd. Niet heel hoog. Ja, voor Grok 4 volgens mij. En dan ook nog de, uh, de, de SuperGrok zeg maar.

260
00:42:10.212 --> 00:42:17.952
Uhm, en volgens mij scoort GPT-5 negen punt zoveel procent daarop, hè. Dat is natuurlijk de eerste die ik ook even langs ging in mijn, uh, onderzoek naar, uh, benchmarks.

261
00:42:18.372 --> 00:42:30.136
Uhm, zijn er-- je had het net over een soortTekenen, inklings, uh, van, uh, potentieel een weg naar AGI, hè. Uh, bijvoorbeeld dat i, uh, wat ook de jongens van Project 2027 aanhouden.

262
00:42:30.176 --> 00:42:40.436
Hoe langer zo'n agent, uh, vol kan houden zonder vast te lopen en zinvolle dingen kan blijven zeggen. Laat dat even duidelijk zijn. Uh, ja, dat, dat is voor hen een van de, uh, key indicators, zeg maar.

263
00:42:40.886 --> 00:42:50.206
Wat zijn voor jou nu dan indicators dat je zegt: uh, da- eigenlijk valt het wel mee. Het valt op een bepaalde manier ook een beetje tegen. Misschien zijn we toch een beetje aan het afvlakken.

264
00:42:50.216 --> 00:43:04.736
Als we onszelf even uitdagen om die kant te verdedigen. Ja. Uh, ik, ik heb het idee dat dat misschien wel minder van OpenAI gaat komen dan van andere labs. Dus, uh, als ik kijk naar--

265
00:43:05.636 --> 00:43:19.056
ik heb dus een paar uur bijvoorbeeld geprogrammeerd met GPT-5, uh, gisteravond en ik kwam er gewoon wel achter dat het bepaalde denkfouten maakt die ik bijvoorbeeld niet terugzie bij Gemini 2.5 Pro.

266
00:43:19.876 --> 00:43:30.156
En ik heb het idee dat doordat ze een soort sweetspot hebben gevonden is het best wel goed, maar ook niet echt heel goed. En ik denk dat er misschien andere partijen zijn die

267
00:43:31.076 --> 00:43:35.496
intenser drukken op het bereiken van het allerslimste model.

268
00:43:35.536 --> 00:43:49.216
En ik denk dat die Arc AGI is een heel goed voorbeeld, waarbij dus Grok 4, uh, 16%, uh, bijna 16% scoort, uhm, wat echt 60% hoger is dan OpenAI's net nieuwe model.

269
00:43:49.756 --> 00:43:58.136
En, uh, die mensen bij de XAI organisatie zaten allemaal op Twitter te zeggen van: ja, en dat is echt een oud model en we zijn al veel verder dan dat intern. Ja, die waren natuurlijk trots, hè.

270
00:43:58.336 --> 00:44:07.356
Ja, ja, die dachten: kijk, wij zijn, uh, veel beter bezig. Dus ik denk dat, uhm, tekenen dat er nog slimmere modellen mogelijk zijn.

271
00:44:08.236 --> 00:44:20.696
Die komen vooral vanuit die signalen dat, dat er op dat soort benchmarks nog best wel echt vooruitgang geboekt al wordt. Maar het blijft heel lastig om te zeggen van: waar liggen de limieten van deze technologie?

272
00:44:20.796 --> 00:44:30.416
Ik denk dat, uh, benchmarks- Zijn jouw eigen hori-- is jouw eigen horizon, jouw eigen scenario's, zijn die anders geworden door de release van GPT-5? Ik vind het zo grappig, iedereen is zo van: horizon update.

273
00:44:30.996 --> 00:44:42.236
Want wat, wat is nu verwachtelijk het limiet van AI? En ik, ik denk dat iedereen wel, uh, een beetje een soort gevoel heeft van: de tijdlijn is langer geworden, zeg maar.

274
00:44:42.276 --> 00:44:52.016
We zijn niet zo super dichtbij echt super intelligence die, uh, mensen heel snel gaat displacen en echt heel veel, heel veel mensen heel snel obsolete gaat maken.

275
00:44:52.936 --> 00:45:00.196
Dat er toch, uh, a-als het, als we echt zo dichtbij zaten, dan zou een bedrijf als OpenAI gewoon meer releasen dan dit. Dat is toch het overheersende gevoel.

276
00:45:01.056 --> 00:45:12.456
Uhm, en ik denk dat daar gewoon wel echt een kern van waarheid in zit. Alleen wat ik, wat ik tegelijkertijd ook wel, uh, belangrijk punt vind, is dat heel veel van dit soort verbeteringen komen in step changes.

277
00:45:13.216 --> 00:45:16.516
En we zitten nog steeds in dat paradigm van reasoning, zeg maar.

278
00:45:16.536 --> 00:45:29.996
We hebben, voordat er reasoning modellen waren had je, zeg maar, een bepaalde plateau van: het wordt niet heel veel beter tussen GPT-4 en GPT-4o en, en ze proberen, zeg maar- Ja, 4,5 was een beetje een dud, natuurlijk.

279
00:45:30.226 --> 00:45:37.986
Ja, precies. Komt uit een eerder paradigma. Ja, en, en toen was met reasoning echt weer een soort nieuwe wind gevonden van: hé, we kunnen hier weer echt, uh, best wel ver mee komen.

280
00:45:38.836 --> 00:45:45.476
En ik denk dat, uh, binnen reasoning is er nog best wel veel mogelijk. Er zit veel rek in reasoning, zeg maar, wat je ermee kunt.

281
00:45:46.236 --> 00:45:57.316
Maar ik denk dat er, uhm, dat er nog wel stappen gezet kunnen worden die nog weer een boost kunnen geven. En ik denk dat we wel allemaal het gevoel hebben dat

282
00:45:58.216 --> 00:46:10.536
zelfs de, de beste systemen die we nu hebben met, die puur, zeg maar, reasoning, uh, scaled up hebben, zijn al echt extreem capabel en waardevol, waarbij ze heel veel taken echt superhuman, pr-, uh, doen.

283
00:46:10.596 --> 00:46:17.776
Dus er is een benchmark van, van, ge-, Google. Gemini 2.5, uh, Deep Think Paper, uh, Report.

284
00:46:18.796 --> 00:46:30.116
En Deep Think is de variant die zij hebben geproduceerd die ze ook hebben gebruikt als basis om die IMO 2025, uh, wiskunde wedstrijd, uh, te winnen of daar een gold medal in te halen.

285
00:46:30.736 --> 00:46:38.236
En in die paper doen ze een onderzoek naar het reproduceren van machine learning research implementaties.

286
00:46:38.595 --> 00:46:49.176
Want zij willen natuurlijk bootstrapen in de zin van: we gaan onze modellen gebruiken om ons proces van modellen maken beter te maken. Ik bedoel, als die cirkel rond is, uh, dan kan je een soort van kopje koffie drinken.

287
00:46:49.326 --> 00:46:59.376
Vliegwiel is. Ja, daar gaat het om. En dan: doe het maar voor mij. En daar zijn twee van de vijf benchmarks die in dat, in zo'n, zo'n benchmark centraal staan van: kun je een machine learning implementatie implementeren.

288
00:47:00.176 --> 00:47:10.076
Uh, daar verslaan ze een expert mens die acht uur de tijd krijgt om zijn beste implementatie op te leveren. Die worden verslagen door dat Gemini 2.5 model.

289
00:47:10.776 --> 00:47:17.176
Dus er zijn al voorbeelden waarbij je beter kunt zeggen: laat een AI model dit deel van de release maar verbeteren.

290
00:47:17.936 --> 00:47:27.276
En ik denk dus dat iedereen wel doorheeft van: als we daar nu zo tegenaan hikken, dan is er, zeg maar, maar één grote unlock nodig en dan is er echt best wel veel aan de hand.

291
00:47:27.596 --> 00:47:43.276
Ja, dan krijg je een soort Cambrian explosion achtige sfeer, namelijk: we weten nu hoe het moet, het werkt en nu kunnen we ook nog eens dat ding gaan gebruiken om de datacentra te verbeteren, om de interne management van ons bedrijf te verbeteren, om al onze onderzoekers te assisteren en deels te vervangen.

292
00:47:43.316 --> 00:47:50.836
En op een gegeven moment gaat het- En waar die limieten allemaal liggen en zo, dat is allemaal lastig, want dan, dan is het een kwestie van bottlenecks. Waar komen de nieuwe bottlenecks vandaan?

293
00:47:50.876 --> 00:47:53.676
Daar hebben we het ook al eerder over gehad, van de bottleneck, het verhaal zeg maar.

294
00:47:54.246 --> 00:48:08.376
[schraapt keel] Maar ik denk wel wat, uh, positief is voor de sector als je het hebt over AI winters en AI summers, waar, zeg maar, als er een tijdje progressie uitvalt dan, dan zie je vaak een soort kleine consolidatie in de markt en dan blijft alleen het nuttige spul over, zeg maar.

295
00:48:09.036 --> 00:48:16.956
En wat je wel ziet is dat, uh, de omzetten van een ChatGPT, maar ook de omzetten van een Gemini en de omzetten van een Anthropic zijn heel gezond.

296
00:48:17.536 --> 00:48:27.296
Dus mensen zeuren wat over hoge salarissen en grote investeringen in CapEx en dergelijke voor datacenter build outs. Maar de omzet die ermee gedraaid wordt is heel serieus.

297
00:48:27.336 --> 00:48:39.596
Dus ik denk dat we een lange periode gaan zien waarbij er makkelijk genoeg geld is om in ieder geval de huidige modellenEhm, te blijven verkopen, dus die zijn waardevol. Alle developers die willen op zo'n model hangen.

298
00:48:39.656 --> 00:48:50.336
Heel veel professionals hebben het nodig voor hun, uh, tekstuele werk. Return on investment op dat model, hè, dat heeft je. Je kan het op de eurocent of dollarcent uitrekenen wat het gekost heeft om dat ding te maken.

299
00:48:50.376 --> 00:48:57.676
Dus dat wil je gewoon terug. Absoluut. Dus het is terugverdienen, het is marge produceren. En zodat je dan free cash flows hebt om dat onderzoek verder te, te zetten.

300
00:48:57.716 --> 00:49:07.576
En ik denk dat je wel ziet, is dat we wel een punt hebben bereikt waar we comfortabel kunnen stellen: de cash flows uit een ChatGPT business die bijvoorbeeld richting de 10 miljard omzet per jaar gaat.

301
00:49:08.136 --> 00:49:15.036
Die kunnen comfortabel heel veel nieuw onderzoek betalen. En we zijn niet eens heel efficiënt nu dat onderzoek aan het doen.

302
00:49:15.316 --> 00:49:26.036
Omdat je door de concurrentiestrijd heel dik moet betalen, omdat iedereen tegelijk al die resources claimt. De resources van menselijk kapitaal, dus de onderzoekers en iedereen claimt de datacenters tegelijkertijd.

303
00:49:26.096 --> 00:49:32.576
Dus we hebben een hele inefficiënte markt. Alles is extreem duur om te kopen en nog kunnen we het bijna financieren vanuit de free cash flow.

304
00:49:32.636 --> 00:49:39.556
Dus ik denk dat dat wel voor mij een beetje een teken is van this is all here to stay. Voor het geval mensen daar nog aan twijfelden. Ja.

305
00:49:39.716 --> 00:49:51.956
Uhm, en, en, en, en zo'n, zo'n, uh, release als GPT-5 draagt daar heel erg aan bij. Dat is echt zo'n motor die die sector dan echt gewoon heel gezond houdt, omdat het gewoon prijseconomisch heel aantrekkelijk is.

306
00:49:51.976 --> 00:50:00.136
Ze verdienen waarschijnlijk een goede marge op en het is heel capabel voor de use cases die mensen veel gebruiken en daar kan dan weer op voortgebouwd worden.

307
00:50:00.356 --> 00:50:10.276
Ja, ik denk ook in dat opzicht, daar hebben we het ook wel vaker over gehad. Maar, uhm, even een, een, een, uhm, anekdote dat ik-- ik was op een gegeven moment op Open Router aan het kijken.

308
00:50:10.416 --> 00:50:13.536
Zo'n, uh, tussen router waardoor je met allemaal modellen tegelijk kan praten.

309
00:50:13.556 --> 00:50:20.796
Als ontwikkelaars prettig en die hebben gewoon statistics waardoor je gewoon kan zien in een week welke modellen het meest aangeroepen worden.

310
00:50:20.836 --> 00:50:29.776
En toen was ik wel even verbaasd dat ik, da-dat ik gewoon zag in zo'n soort spekkoek, uh, aan, uh, chart van OpenAI is daar maar 5% in of zo, hè.

311
00:50:29.816 --> 00:50:39.166
En dan in de categorie programmeren was dit trouwens, hè, wat zij beschrijven. Dat moet je wel even, dat is het ding aan die, die open data is super nice dat ze dat doen van een open router, dat is heel waardevol. Mhmm.

312
00:50:39.516 --> 00:50:50.636
Maar je moet niet vergeten dat die data super skewed, die is heel skewed naar bijna niemand gebruikt op schaal OpenAI modellen via open router, zeg maar. Nee, nee, precies.

313
00:50:50.656 --> 00:51:00.676
Dus ik, mijn punt was ook zeker dat is niet de markt, hè, want je hebt geen idee wie allemaal, uh, OpenAI direct aanroept op de, op de API. Maar, uh, ik vond er nog wel een signaal in zitten.

314
00:51:00.716 --> 00:51:03.996
En daarmee bedoel ik niet OpenAI is helemaal niet populair bij programmeurs.

315
00:51:04.056 --> 00:51:13.336
Ik denk dat gewoon heel veel, ik denk dat cloud code op dit moment in combinatie met, uh, uh, cloud modellen een, een, een, een momentje heeft de laatste maanden. Laat ik het dan zo zeggen. Ja.

316
00:51:13.376 --> 00:51:22.075
Maar ik denk dus dat, uh, dat helemaal niet per se een reden voor alarm hoeft te zijn binnen OpenAI. Uh, ik bedoel, het is prettig om geld te verdienen aan ontwikkelaars.

317
00:51:22.216 --> 00:51:30.876
By the way, Anthropic is rate limits aan het instellen omdat het helemaal niet zo goed lukt om dat max plan daadwerkelijk, uh, uh, betaalbaar te houden. Maar goed, ik kan me, wat ik eigenlijk wil zeggen is:

318
00:51:31.876 --> 00:51:42.416
ik kan me goed voorstellen dat je een, uh, even een fictieve meeting binnen OpenAI hebt waar je zegt: oké jongens, op open route zien we of we zien eigenlijk dat we qua ontwikkelaars, uh, nog maar 20% van de markt hebben.

319
00:51:42.936 --> 00:51:54.996
Uh, de connaisseurs op Twitter zijn allemaal pissed dat onze modellen lame zijn en dat dan Sam Altman zegt: gast, we gaan naar 1 miljard consumers toe en dit is gewoon de revenue stream die we hebben uit een daadwerkelijk product hebben, hè.

320
00:51:55.036 --> 00:52:01.855
Dus je, je kunt succesvol zijn in een, in een, in een markt, terwijl je misschien minder succesvol lijkt op andere punten.

321
00:52:01.876 --> 00:52:10.856
Ik, ik, ik wil hier niet mee zeggen: alles zit wel goed bij OpenAI, het is allemaal prima, hè, want ze voelen enorme druk vanuit, uh, uh, DeepMind op het moment en Anthropic en, uh, uh, Grok.

322
00:52:11.296 --> 00:52:16.756
Maar ik, ik kan me wel voorstellen dat, uh, even heel suf voorbeeld hoor, maar ik was laatst in Japan.

323
00:52:16.796 --> 00:52:31.356
Ik was, ik had even vakantie en ik zat in een guesthouse en we zaten met een groep mensen daar te eten en ik hoorde om me heen gewoon heel vaak chat of ChatGPT, dat was even al een ding, dus ik dacht op een gegeven moment ik ga toch nou even een soort journalistiek doen en gewoon even met wat mensen met wat saké wijn erbij praten.

324
00:52:31.816 --> 00:52:37.716
Het bleek gewoon dat, nou, wat was het, van de negen van de tien mensen in dat guesthouse had hun complete reis gepland met ChatGPT.

325
00:52:38.396 --> 00:52:55.596
En dan kan je zeggen: ja, boeie, dat was vroeger Google, maar ik vind dat wel, zeg maar een kleine, het leeft enorm als product bij de eind-eindgebruiker en ik denk dat het niet zo gek is dat OpenAI veel aandacht besteedt aan daar een fenomeen blijven, hè, de eerste keuze.

326
00:52:55.616 --> 00:53:01.956
Ja, het is gewoon, uh, hun waardevolste markt. En waar ze het verst voorlopen. En dat momentum is heel erg lastig in te halen.

327
00:53:01.996 --> 00:53:13.556
Dat is ook een eigenschap van consumentenbedrijven is dat als ze eenmaal, uh, heel veel bekendheid genieten en momentum hebben, dan is het heel moeilijk om daar overheen te komen. Zelfs met een veel beter product.

328
00:53:14.176 --> 00:53:23.526
Uhm, en dat is gewoon toch wel wat je ziet, is dat mensen stappen niet zomaar over consumenten, zeker niet iets heel nieuws. Compleet nieuw paradigma. Het is een soort chatbot en je kan ermee praten.

329
00:53:23.556 --> 00:53:29.376
Je kan een foto naar sturen, weet je wel. Die gaan als ze iets hebben wat werkt heel, helemaal niet snel op zoek naar een alternatief.

330
00:53:30.116 --> 00:53:40.136
Uhm, maar ik dacht dus ook wel misschien, uh, hè, zie je dus een beetje de coding markt wel en, uh, focussen puur meer op ChatGPT en zie je steeds minder aandacht voor het coding gedeelte.

331
00:53:40.556 --> 00:53:47.326
Maar dan zie je toch weer dat die Amerikaanse cultuur misschien, uh, de, de kop opsteekt en zegt: nee, we willen coding ook winnen. [lachend] We wanna win it all. Ja.

332
00:53:47.476 --> 00:53:53.396
Dus ik vond het wel mooi om te zien dat toch wel een soort, uh, ja, eigenlijk wel comeback hebben gemaakt in de coding, uh, wereld.

333
00:53:53.436 --> 00:54:03.156
Want ik denk dat, uh, 80 tot 90% van de developers eigenlijk OpenAI modellen best wel links liet liggen in de cursor IDE's en de cloud code gebruikers.

334
00:54:04.036 --> 00:54:08.436
Omdat je gewoon veel beter Gemini of Cloud kon gebruiken in die, uh, programmeeromgevingen.

335
00:54:08.476 --> 00:54:30.408
En nu, uh, hebben echt een aantal mensen die echt, uh, neutraal erin staan gezegd: ja, ik ben helemaal om naar GPT-5 en inclusief ikzelf heb nu het idee datDat GPT-5 mijn daily driver is en dat ik soms misschien voor super hard reasoning dingetjes nog een keertje effe bekijk wat OpenAI zegt of effe kijkt wat, uh, uh, Gemini 2.5 zegt.

336
00:54:30.828 --> 00:54:41.328
Maar qua usability en kwaliteit zit, uh, GPT-5 echt wel op een sweetspot waardoor ze nu denk ik king of the hill zijn. En dan zie je ook dat er heel veel developers maar in een keer, fuck, gewoon hun gebruik overgooien.

337
00:54:41.748 --> 00:54:46.498
Heel anders dan in de consumentenbusiness. Want in de consumentenbusiness gaat niet iedereen even ChatGPT gebruiken.

338
00:54:46.508 --> 00:54:56.568
De loyalty speelt lager bij ontwikkelaars, want die weten wat endpoints zijn en die weet, die, die, die zijn natuurlijk- En er zit Cursor tussenin, hè, want Cursor die maakt het een, een, een model dropdown picker.

339
00:54:56.648 --> 00:55:05.548
En dat is een, echt een belangrijk, uh, aspect, want ik weet nog dat in het begin, dan kon je wel switchen naar Google's modellen in Cursor, maar dat werkte voor geen meter omdat ze dat niet testen en zo.

340
00:55:05.608 --> 00:55:16.408
En nu zijn ze echt wel gewoon als een soort driepoot in ieder geval. We integreren minimaal ChatGPT of, of OpenAI's modellen, Gemini's modellen en Anthropic modellen op heel hoog kwaliteitsniveau.

341
00:55:16.828 --> 00:55:26.338
Dat is gewoon de minimum support, uh, structure. En dan daarna Grok 4 erbij en daarna open source modellen erbij, uhm, en, maar die maakt het dat die concurrentiestrijd heel heftig is binnen Cursor.

342
00:55:26.348 --> 00:55:29.858
Ja, Cursor creëert zo'n Hunger Games door die dropdown. Absoluut.

343
00:55:29.908 --> 00:55:36.818
Als je een, als je een analyse zou maken over de markt nu, zeg maar voor, om het in de geschiedenisboeken te zetten, zou je een boek kunnen maken met die model picker op de voorkant gewoon.

344
00:55:36.828 --> 00:55:43.308
Want die model picker, dat is gewoon keiharde non-loyalty van ontwikkelaars om te zeggen: oké, ik switch weer over, ik switch weer over. Ja.

345
00:55:43.468 --> 00:55:52.728
En dat het ook drop-in replacements zijn dankzij het feit dat al die scaffolding die Cursor doet op model specifiek ook nog eens helemaal klopt. Het is niet alleen maar een endpoint switch. Nee.

346
00:55:52.788 --> 00:56:00.908
Ze weten dus- Zij zorgen ervoor dat al die prompts en al die dingen, hoe je met die b-, met die, met die verschillende API's van die providers interacteert, dat dat allemaal heel goed werkt.

347
00:56:01.448 --> 00:56:11.568
En dat, dat is, ik denk ik op dit moment is Cursor de nummer één concurrentieaanjager op het gebied van coding, uh, modellen. Ja, omdat het die, omdat ze ertussen zitten.

348
00:56:11.748 --> 00:56:20.348
Wat eigenlijk voor ontwikkelaars prettig is, omdat die druk dan zo op die labs blijft staan om allemaal kwaliteit te leveren. Ja, concurrentie is goed voor de eindgebruiker. Ja, ja, ja.

349
00:56:20.378 --> 00:56:21.768
Hé, want we, ik, ik zat nog te denken.

350
00:56:21.888 --> 00:56:36.128
Ik wil, uhm, ik, ik hoor een beetje in het verhaal van oké, in het, uh, soort van, uh, AGI komt eraan narratief, uh, is het niet meteen, uh, uh, het gaat niet meer gebeuren op de korte termijn, hè.

351
00:56:36.178 --> 00:56:46.888
Ik bedoel, effe die, ik, ik heb nu een aantal keer Project 2027 genoemd. Uh, dat weten de luisteraars die langer luisteren ook. Dat is niet een scenario wat ik 100% onderschrijf en zeg: zo gaat het gebeuren.

352
00:56:47.168 --> 00:56:53.588
Ik vind het een interessant datapunt en een fenomeen om mee te nemen als je geïnteresseerd bent in dit soort, uh, gesprekken en dit onderwerp.

353
00:56:54.148 --> 00:57:00.048
Uh, persoonlijk zit ik op een wat langere tijdslijn, maar niet verder dan 10 jaar en dat vind ik nog steeds maatschappelijk totaal disruptief.

354
00:57:00.108 --> 00:57:06.648
Dus ga-, kunnen we dan, we kunnen met koffie gaan praten over twee, vijf of 10 jaar, maar dat is nog steeds allemaal best wel een ding. Best snel, ja.

355
00:57:07.028 --> 00:57:13.248
Ja, best wel een ding, dus ik, z- noem het voor mij Project twen-2032. I don't care. Uh, iets om in de gaten te houden.

356
00:57:13.648 --> 00:57:19.928
Niet volledig weerlegd met GPT-5, maar ook niet soort van-- het had ook zo kunnen zijn dat GPT-5— ik wist het niet.

357
00:57:20.008 --> 00:57:30.108
Ik ging gisteravond kijken en ik, ik start echt die livestream en toen dacht ik: nou, ik ben, ben heel benieuwd, zeg maar. Het wordt of echt een 4.5-achtige dud, het valt echt heel erg tegen. Dat is gewoon niet zo.

358
00:57:30.168 --> 00:57:40.488
In ieder geval in mijn ogen. Subjectief, want ik, ik is het voor mij- 4.5 was echt een mega dud. Ja. Echt een mega dud op een hele, hele grote schaal. En GPT-5 is dat echt niet. Uhm.

359
00:57:40.568 --> 00:57:50.588
Dus we zitten op een soort— en sterker nog, de grafieken van bijvoorbeeld die Meter Benchmark lopen nog gelijk. Dat vond ik wel grappig, want die hebben dus een projectie gedaan en daar valt- Dat het een exponent is.

360
00:57:50.988 --> 00:58:00.648
Ja, het is, ja, en het is pretty much alsof OpenAI net zolang is blijven doortrainen tot ie op het lijntje viel en dat het gewoon dat lijntje kon blijven lopen, dus, uh, dat, dat, dat klopt ook nog, uh, uh, best wel goed.

361
00:58:00.928 --> 00:58:06.168
Het is alleen niet, uh, in mijn ogen, uhm, wat bijvoorbeeld Genie-3 wel voor mij heeft gedaan.

362
00:58:06.188 --> 00:58:12.968
Ik ga toch even eerder over Genie-3 praten dan GPT O-OSS, omdat ik denk dat we Genie-3 op een aantal manieren hierin kunnen, uh, vouwen.

363
00:58:13.688 --> 00:58:27.008
Toen ik, uh, kijk, toen ik Genie-3 zag, uh, uh, en voor de luisteraar, we zijn al wat meer bekend met, uhm, uh, nu ben ik even het andere, uh, moed-doe- hoe heet het, andere visuele model van, uh- World model.

364
00:58:28.188 --> 00:58:31.588
Ja, waarin je, uh, filmpjes maakt. Veo, sorry.

365
00:58:31.908 --> 00:58:40.548
Ik, ik haal ze zelf, dus ik wil— luisteraars zullen ze misschien ook door elkaar halen, maar Veo is het videogeneratiemodel van Google DeepMind waarin je geen invloed hebt achteraf.

366
00:58:40.588 --> 00:58:42.788
Je kan een promptje maken, dan heb je een video en dat was het.

367
00:58:43.248 --> 00:58:57.388
De Genie-series, heb je een keyboard controls, alsof je in een computergame bent en kan jij nadat je je prompt hebt ingevoerd het karakter wat dan in beeld komt, dat kan een koe zijn, een blaadje, een auto of een boom, whatever, waar jij controle over wil krijgen, kan jij gaan besturen.

368
00:58:57.428 --> 00:59:07.428
Je kunt gaan rondlopen in die wereld. Die Genie-serie kenden we al. We kenden hem ook van andere partijen al. Je had meer van die soort active dreaming simulators. Oasis, Descartes of zo. Exact.

369
00:59:07.438 --> 00:59:13.108
Dat soort, uhm, Minecraft simulaties. We hebben het in de nieuwsbrief ook een aantal keer aangehaald. Dat voelde allemaal redelijk psychedelisch.

370
00:59:13.188 --> 00:59:24.808
Als in: je hebt, je had echt het idee dat je visueel door een hallucinatie heen liep die ook allerlei artifacts had. Dat had de Genie-serie tot en met Genie-3, of tot Genie-3 ook.

371
00:59:25.228 --> 00:59:41.008
De Genie-3 series op 27p, 30 fps uit mijn hoofd. 24. Kan, ja, ne-, 24, nice, kan een, uh, uh, bijzonder consistente, uh, controleerbare droom voor jou genereren. Niet voor jou als eindgebruiker nu live, hè.

372
00:59:41.048 --> 00:59:51.588
We kijk- bekijken de demo's zoals ze er staan. Maar bij, uh, Genie-3, en ik heb dat bij Veo ook gehad destijds en nu had ik het bij Genie-3 weer, krijg ik een ander geboe- gevoel in mijn buik.

373
00:59:51.658 --> 01:00:02.048
Een soort mix van vlinders en angst. Ik kan het niet anders omschrijven als dat. Een soort verliefd en het is superspannend wat hier allemaal gebeurt. Uhm, uh, hoe had jij dat, zeg maar, bij Genie-3?

374
01:00:02.128 --> 01:00:08.768
Had jij ook z-, uh, zag jij hem al zover aankomen en had je zoiets van: ja, had ik al gezien. Of zag je ook van: oké, damn, dit is wel echt een ding, man.

375
01:00:09.108 --> 01:00:16.148
Ja, nee, ik denk dat, ik kan echt wel momenten pinpointen wat, uh, in San Francisco genoemd zou worden feeling the AGI.

376
01:00:16.908 --> 01:00:30.424
En ik had, uh, het moment dat ikClaude 4 Sonnet in Cursor met een terminal aan de slag zag gaan, zeg maar, die gewoon even een terminal commandje dit, terminal commandje dat en dat dan een heel ding voor mij uitzocht.

377
01:00:30.544 --> 01:00:40.424
Een beetje als die meter benchmark van hoe lang die agentic doorgaat. Dat was voor mij echt een feeling the AGI moment. Uhm, en ik had dat bij Genie 3 ook weer. Uhm,

378
01:00:41.444 --> 01:00:46.804
nog meer of niet eens nog meer, maar nog een keer nadat ik ook Vio 3 had gezien.

379
01:00:46.824 --> 01:00:56.264
Dus ik had dat ook bij Vio 3 dat ik denk: oké, echt toen ik audio en video bij elkaar hoorde en die voorbeelden zag, dacht ik: oké, dit is echt zo'n what the fuck moment.

380
01:00:56.304 --> 01:01:03.624
Echt een zero- Ja, ik ben toen ook weer even een stukje gaan lopen buiten, zeg ik ook altijd. Maar ik, ik moest echt even touch grass, want echt even niet goed. What the heck?

381
01:01:03.684 --> 01:01:14.164
Dus dat was heel, vooral die meta scenario's dat mensen zeggen van: uh, the prompt master is controlling us, we will get him. Ja, en dat ze tegen het glas van de camera gaan slaan om eruit te komen. Precies. Niet best.

382
01:01:14.424 --> 01:01:26.604
Dat je denkt van: oké. En dat je dit dan met die, met die Genie 3. Genie 3 heb ik nog niet kunnen proberen en ik denk dat het nog meer, uh, leeft als je het echt uitprobeert.

383
01:01:26.664 --> 01:01:38.324
Ja, ik heb wel een aantal hands ons kunnen vinden van mensen die al een weekje toegang hadden tot Genie 3 in de persruimte van, uh, DeepMind/Google. Uhm, daar merkte ik juist aan, dat is echt wel grappig.

384
01:01:38.584 --> 01:01:52.704
Die waren in mijn ogen een beetje overhyped, terwijl ik, en, maar misschien dus niet, als in die video's, hè, je moet je voorstellen, die hebben een week daarvoor al toegang gehad tot Genie 3 en mogen die game controller, zo'n PlayStation-achtige controller, beetpakken en er doorheen gaan lopen.

385
01:01:52.744 --> 01:02:03.564
En dan, en dan gaan ze daarna al meteen takes maken, zeg maar hot takes van wat ze daar gevoeld hebben en die staan gewoon in de gang naar buiten die ze echt in de camera te schreeuwen van: what the hell, what the hell, what the hell?

386
01:02:03.624 --> 01:02:08.164
En ik bedoel, ik denk als je dan een week later een video van hun kijkt, zijn ze wel wat rustiger geworden.

387
01:02:08.444 --> 01:02:21.484
Maar ik, ik, ik kan me wel voorstellen dat het, uhm, hal-- het is eigenlijk lucid dreaming, hè, dus controle krijgen over een droomscenario die consistent blijft. Want dat, een van die demo's- Ja, minutenlang, hè.

388
01:02:22.044 --> 01:02:31.904
Minutenlang gestoord. Een van die demo's is dat ie, dat vond ik trouwens nog steeds de meest wauw-se demo, is dat ze blauwe verf op een muur verven. Ik, ik, ik dacht: gaat hij de blauwe verf demo zeggen? Ja.

389
01:02:31.944 --> 01:02:44.844
Die is zo saai en zo ground, zo gestoord, zeg maar. Het is natuurlijk perfect. Het is bijna art. Het is zeg maar de combinatie van iets superbanaals, zo'n muur verven. Ja. Maar dan zo bijzonder technologisch.

390
01:02:44.884 --> 01:02:48.734
Dus gewoon dit kon je absoluut niet bouwen gewoon. Nee joh, absoluut niet.

391
01:02:48.824 --> 01:02:58.644
Nee, maar ik bedoel, maar dit is denk ik ook het ding, hè, omdat wij, ik, ik, ik weet nog wel eens dat ik dan, uh, toen ik nog lesgaf aan de hogeschool, kreeg ik wel eens dingen gedemo'd door studenten.

392
01:02:59.024 --> 01:03:08.223
Die heb je dan dingen uitgelegd, uh, je, en dat is binnen een bepaalde scope van wat zij dan kunnen. Hè, dus je gaat ervan uit als zij het eind van de week aan mij demonstreren, dan is dat binnen die scope.

393
01:03:08.664 --> 01:03:15.384
En dan heel sporadisch zag ik dingen dat ik zei: wow, wat heb jij nou gedaan? Dit is niet normaal. Weet je wel?

394
01:03:15.504 --> 01:03:26.184
Terwijl ik was op dat moment echt de enige die dat echt op waarde kon schatten, omdat ik wist wat die student daarvoor kon. Ik wist welke informatie ik heb gegeven en wat de scope was van de opdracht.

395
01:03:26.204 --> 01:03:35.764
En als iemand daarbinnen dan voorbij de scope gaat en echt iets heel bruuts doet, kan ik technisch en qua achtergrondinformatie inschatten: hier gebeurt iets heel bijzonders, hè.

396
01:03:35.844 --> 01:03:43.104
Dat compliment kregen ze dan van mij ook heel vaak van: of je hebt je broer laten meehelpen hieraan of jij hebt gewoon net even jezelf voorbijgestreefd.

397
01:03:43.244 --> 01:03:55.654
En ik, als, ik denk dus dat wij als, als je wat dieper in deze materie zit en dan die verfdemo krijgt, en voor de luisteraars, iemand heeft een verfroller met blauwe verf dat hij op een verf rolt, op een muur rolt, dan verder kijkt dan dat, hè.

398
01:03:55.704 --> 01:04:00.684
Dus die draait eigenlijk de rest van de muur uit beeld. Dus die kijkt naar rechts, zeg maar, en die kijkt dan terug.

399
01:04:00.704 --> 01:04:06.884
En ja, daar zit nog steeds die verf op die muur en ik kan me heel goed voorstel- Op dezelfde manier hoe het erop gespoten- Ja, het druipt nog, zeg maar.

400
01:04:07.104 --> 01:04:18.364
En ik kan me voorstel-, ik bedoel, lo-, en het ziet er trouwens fotorealistisch uit. Dat, dat eerste feit is eigenlijk het Vio-feit, hè, dus het generaten van lifelike imaging in videovorm was al gestoord.

401
01:04:18.384 --> 01:04:24.264
Dat we daar al aan gewend zijn is al te bizar. En dan heb je daarnaast ook nog eens: ja, maar die wereld is er daarna nog.

402
01:04:24.404 --> 01:04:34.294
Als je terugkijkt zit die data daar nog en ik, en dan kan je als luisteraar denken: dan sla je dat toch even ergens op? Nee man, zo makkelijk is dat niet. Dat kan je in de echt niet. Nee, dus, dus dat is heel bijzonder.

403
01:04:34.444 --> 01:04:43.944
En wat ik vooral, uh, waarom ik zo enthousiast ben over Genie 3, dus het is sowieso heel knap dat ze dat kunnen simuleren, dat ze dat, dat ze dat niveau van fidelity zeg maar voor elkaar hebben gekregen.

404
01:04:44.744 --> 01:04:49.404
En, uh, wat ze ook hebben dus toegevoegd is dat, uh, promptable events.

405
01:04:49.804 --> 01:05:01.664
Dus dat je ook tijdens dat het al bezig is, kan je bijvoorbeeld, je loopt bijvoorbeeld door een straat en dan kan je zeggen, je loopt bijvoorbeeld naast het water en dan zeg je: er komt nu in een keer een jetski voorbij en dan zie je in een keer zo'n jetski voorbijkomen.

406
01:05:01.724 --> 01:05:08.994
Dus dan gebeurt er iets op basis van wat je hebt gezegd. Nou, dat is natuurlijk een soort ultieme game engine-achtige omgeving. Dit is gewoon een soort Unity engine.

407
01:05:09.654 --> 01:05:16.224
W-die mensen waar je helemaal los kunnen gaan op games. En games is leuk. Games is fantastisch. Je kan er heel veel vette dingen mee doen, maar er is natuurlijk- Nog mij het minst die games.

408
01:05:16.344 --> 01:05:29.404
Ja, nou ja, ik ben ook niet zo'n gamer. En, uhm, wat ik vooral heel interessant vind is dat, ze, ze kunnen een heel groot, uh, openstaand probleem oplossen, uh, in embodied robotics.

409
01:05:29.594 --> 01:05:42.464
Dus als je een robot in de echte wereld wil plaatsen, dan is het voor-voorheen is het altijd extreem moeilijk geweest om robots betrouwbaar te laten functioneren, omdat het zo godsmoeilijk is om data te verzamelen van die robot in operatie.

410
01:05:43.224 --> 01:05:51.404
En simulaties- Ja, ik zeg altijd, sorry dat ik je onderbreek, maar ik zeg altijd: in de fabriek. Het is ook nog een gecontroleerd iets. Je weet waar alle kasten staan, waar alle machines staan.

411
01:05:51.444 --> 01:05:58.684
Je hebt het gevoel under control. Maar dat er die, dat er die middag iemand is die die machine komt repareren, zijn zoon bij zich heeft, die daar dan ook rondloopt.

412
01:05:58.744 --> 01:06:06.944
En trouwens met een warm kopje koffie wat hij voor zijn vader gehaald heeft. Dat zat nou net even niet in de trainingsset. Precies, precies. Dus dat is een heel groot openstaand probleem.

413
01:06:06.984 --> 01:06:22.924
En ik denk dat, uh, er hebben wel mensen pogingen gedaan om simulaties te bouwen die, uh, goed, zeg maar de essentiële dingen, want het is dan een modelVan de omgeving, maar heel gesimplificeerd vaak nog.

414
01:06:23.304 --> 01:06:32.204
En daar dan proberen ze in een, een, een soort offline training te doen, alsof die honderd of honderd miljoen keer alles kan zien, alle variaties. En dan gaan ze kijken.

415
01:06:32.264 --> 01:06:38.584
Gaat dat ook echt werken als het in de echte wereld komt, waar natuurlijk heel veel dingen niet in zitten die in dat model, uh, zouden moeten zitten.

416
01:06:39.504 --> 01:06:49.764
Maar door een soort holistische world, uh, simulation te maken, zo'n world model wat gewoon de algehele realiteit probeert te modelleren met, uh, nauwkeurige physics zeg maar.

417
01:06:49.824 --> 01:06:54.064
Dus, uh, hoe verf zich gedraagt, hoe muren zich gedragen als daar een auto tegenaan rijdt, et cetera.

418
01:06:54.664 --> 01:07:10.964
Als dat hoog genoeg in resolutie komt, dan kan je die gap tussen wat je kan doen in de echte wereld en wat je kunt doen in simulatie zo klein maken dat je mo-, uh, uh, ro-robots kunt creëren die heel, uh, betrouwbaar en autonoom kunnen opereren in de fysieke wereld.

419
01:07:10.984 --> 01:07:21.924
En ik denk dat iedereen heeft het gevoel dat de AI wave heel erg gaat over de, de white collar jobs, de, de, de, de desk jobs, de, de, de intellectuele nadenkbanen of zo en taken.

420
01:07:22.344 --> 01:07:27.624
Maar ik denk dat er wel heel duidelijk een push is van dat ook in de fysieke wereld doen.

421
01:07:27.684 --> 01:07:36.304
En Tesla claimt natuurlijk ook met Tesla Optimus en dergelijke, maar dit soort doorbraken zijn echt nodig, want je kunt gewoon niet simuleren in de echte wereld op grote schaal.

422
01:07:36.884 --> 01:07:46.724
Uhm, dat is gewoon, dat blijft altijd schaarse data. Ja, ik denk ook, het, het is ook va-- ik denk voor veel mensen, ik heb dit al een aantal keer, uh, uh, gezegd, maar i-ik blijf het even zeggen.

423
01:07:47.304 --> 01:07:55.834
Die robotica is niet zozeer een hardware issue, zeg maar servomotoren, uh, combineren tot een soort servo-ecosysteem waarin jij bewegingen kunt maken.

424
01:07:56.264 --> 01:08:03.684
Ga naar productielijnen van auto's in de jaren 80 en daar komen al armen langs die gewoon een complete auto kunnen lassen, zeg maar. Ik bedoel, daar zat het probleem niet.

425
01:08:03.724 --> 01:08:07.304
Het probleem zit hem en zat hem iets minder dus, of zit hem iets minder dus nu

426
01:08:08.224 --> 01:08:19.624
in een open wereld vol met kansen en dingen die je niet kunt voorspellen en bewegingen en op, en ook nog eens, uh, uh, hoe een object reageert. Wat gebeurt er als je iets lichts oppakt?

427
01:08:19.644 --> 01:08:28.324
Wat gebeurt er als je iets zachts oppakt? Wat gebeurt er als je iets glads oppakt? Wat gebeurt er als je die, die dingen na elkaar moet doen en in één doos moet stoppen? In welke volgorde moeten ze er dan in?

428
01:08:28.744 --> 01:08:36.564
Noem allemaal maar op en je merkt dus dat, ik vond het wel een leuke, uh, uh, uh, benchmark. Ik maak heel even het sprongetje terug naar GPT-5.

429
01:08:36.984 --> 01:08:43.804
Een van de privé benchmarks van een van de ontwikkelaars die ik volg is dat hij tegen die taalmodellen zegt: ik ga staan als mens.

430
01:08:44.184 --> 01:08:55.604
Ik doe mijn linkerhand achter mijn rechterknie en mijn rechterhand achter mijn linkerknie en nu ga ik lopen. Wat gebeurt er? En alle modellen, inclusief GPT-5, zeggen: je valt. Terwijl dat is helemaal niet zo.

431
01:08:55.664 --> 01:08:58.284
Je gaat gewoon op een ongemakkelijke, grappige manier lopen.

432
01:08:59.004 --> 01:09:18.124
Maar als jij dit zou maken, uh, in VO3 of in Genie3, hè, dus je laat in essentie, ik zeg het even heel, uh, dom nu, hè, want zo gaan die modellen niet werken, maar je laat een toolcall doen naar, laten we zeggen Genie3 door een taalmodel, reasoning model, agentic model, die zegt: oké, ik ben even aan het nadenken.

433
01:09:18.224 --> 01:09:27.243
Oftewel ik ben het me aan het inbeelden met Genie3, waarin de prompt is: de gebruiker vraagt of ik iemand een, h-ha-hand achter zijn ene knie, hand achter zijn ach-- andere knie.

434
01:09:27.304 --> 01:09:35.424
Dan kijkt hij frame voor frame de beelden die gegenereerd zijn door zijn maatje Genie3 en dan zegt hij tegen jou: dan loop jij wat ongemakkelijk, want dat heb ik net gezien in mijn droomwereld.

435
01:09:35.844 --> 01:09:44.064
En als, ik denk dat als mensen dit meer gaan- Dit vind ik wel gaaf, hoor, want ik had, uh, zelf nog niet eens de link gelegd tussen dat je die modellen naar elkaar toe kan brengen.

436
01:09:44.104 --> 01:09:53.704
In mijn hoofd was het nog gecompartamente- gecompa-partimenteriseerd. Dit is hoe die ARC Challenge gewoon keihard wel gebied gaat worden, ARC2. ARC2 gaat door een ensemble van Genie en whatever gebied worden.

437
01:09:53.744 --> 01:10:02.184
Nou, di-dit is dus ook een, uh, uh, ook, uh, Fei-Fei Li is een, uh, AI onderzoeker. Die is echt heel gerenommeerd, want zij heeft ImageNet afgetrapt.

438
01:10:02.204 --> 01:10:08.604
En ImageNet is echt de ontketening geweest van deep learning, omdat daar de eerste vision modellen getraind zijn.

439
01:10:08.964 --> 01:10:19.303
En dat was een soort wel kritisch moment, want zij had ImageNet als dataset en challenge bedacht, waarbij je dat uiteindelijk alleen kon oplossen met deep learning modellen. En er waren toen ook toevallig GPU's.

440
01:10:19.644 --> 01:10:26.044
Maar zij zegt dus, zij is zeg maar heel pop, of heel, uhm, legendarisch in, in, in wat zij heeft betekend voor het veld.

441
01:10:26.424 --> 01:10:37.444
En zij heeft dus recentelijk geclaimd op podium bij Y Combinator, is een, uh- Ja, ik aanraden die talk, staat gewoon op YouTube. Kan je op YouTube kijken en, uh, daar heeft ze dus over physical intelligence.

442
01:10:37.544 --> 01:10:47.904
Of in ieder geval de embodied soort van dimensional spatial intelligence heet het volgens mij. En dat is gewoon iets wat nu heel erg ontbreekt bij die taalmodellen.

443
01:10:48.484 --> 01:10:53.104
En inderdaad, wat jij zegt, als je dus echt gewoon die systemen begint te fuseren.

444
01:10:53.144 --> 01:11:02.864
En wat je dus altijd ziet, en dat zie je ook bij GPT-5, is dat die systemen, die worden eerst aan elkaar geknoopt als een soort Rube Goldberg machine, zeg maar, van, uh, dan doe je dit en dan ga je naar de machine.

445
01:11:03.104 --> 01:11:08.104
Maar uiteindelijk komt dat natuurlijk wel bij elkaar in een soort unified ding en dan, dan kan het nog verder losgaan.

446
01:11:08.784 --> 01:11:18.944
Uhm, maar dat wil niet zeggen dat het combineren van een GPT-5 met een Genie-model, dat dat, dat daarop kan opereren en die visi-, de, die, die, al die visuele inputs ook kan, uh, interpreteren.

447
01:11:19.404 --> 01:11:28.604
Dat daar wel een soort, uh, krachtige wisselwerking kan ontstaan. Dus, uh, ja, ik denk dat we voorlopig nog wel even druk bezig zijn, uh, met, uh, het hele AI-verhaal.

448
01:11:28.924 --> 01:11:40.004
Ja, en ik denk misschien nog wel een, een, een leuk detail is dat als je de interviews kijkt, uh, die nu allemaal rondom Genie3 gedaan zijn, hè. Dus, uh, voor de luisteraars: zoek gewoon even Genie3 launch interviews.

449
01:11:40.144 --> 01:11:44.924
Dan gaan ze met de ontwikkelaars die binnen DeepMind Genie3 in de Genie-serie ontwikkelen, zeg maar, interviewen.

450
01:11:45.624 --> 01:11:53.944
En wat mij gewoon opviel, inc-, ook bij Demis Hassabis trouwens, uh, uh, [lacht] lead, uh, DeepMind, de verbazing over Genie.

451
01:11:54.644 --> 01:12:02.204
Zij zitten daar echt in die interviews van: yo, we hadden op een gegeven moment door dat je dit kon blijven schalen, hè, dus want Genie zit nog helemaal in de scaling paradigm.

452
01:12:02.244 --> 01:12:08.044
Ze hadden gewoon verwacht als we van Genie 2 kunnen we gewoon doorschalen naar Genie 3 zonder al te complexe nieuwe uitvindingen te hoeven doen, hè.

453
01:12:08.084 --> 01:12:13.004
We hebben gewoon krachtigere, grotere datasets, meer hardware, et cetera nodig. Klassieke schalen zeg maar.

454
01:12:13.544 --> 01:12:27.884
En dat zij zeggenDat de real world physics, hè, de fluid dynamics, uh, uh, gravity, gewoon alle, alle belangrijke zaken die zo zwaar zijn om te simuleren als je dat expliciet doet, hè, dat die er nu impliciet in terechtgekomen zijn.

455
01:12:27.904 --> 01:12:37.964
En dat is niet perfect, hè, trouwens niet 100%, nog niet perfect, maar iedere keer weer beter. Gewoon het gooien van een, van een stuk piepschuim op een zee waar dan zout in het water zit.

456
01:12:38.004 --> 01:12:53.724
En op een of andere manier gebeurt dat en lukt dat omdat die in, tijdens het trainen blijkbaar uit al die bestaande beelden een soort intuïtie ontwikkeld wordt for lack of better term, door dat model voor, uh, natuurkunde.

457
01:12:54.064 --> 01:12:57.684
Een veel betere en, en complexere intuïtie dan in taalmodellen.

458
01:12:57.724 --> 01:13:05.783
Want ik bedoel, dat heb ik wel vaker gezegd over taalmodellen dat die soort van belachelijk gemaakt worden als ze bijvoorbeeld niet snappen dat jij gewoon kan lopen met een hand achter je knie.

459
01:13:06.064 --> 01:13:09.924
Het feit dat ze iets kunnen zeggen over de situatie als taalmodel is gestoord.

460
01:13:10.144 --> 01:13:20.904
Zeg maar, je bent ze helemaal buiten hun kunnen aan het trekken als je over fysie-, over fysieke bewegingen gaat praten met iets wat getraind is op Reddit en allerlei andere databronnen, zeg maar.

461
01:13:21.284 --> 01:13:32.864
Hè, dus ja, ik vind dat denken in ensembles van modellen die goed zijn in het ene en goed zijn in het andere en samen een ding vormen, net als ons brein die verschillende cortexen heeft voor verschillende taken, helemaal niet zo gek.

462
01:13:32.924 --> 01:13:43.064
Nee, en, en dat is, ik, uh, dat is mijn pinned tweet, uh, is, is, uh, op, op X, uh, is: if you can compress data well, you understand its patterns.

463
01:13:43.704 --> 01:13:57.444
En er is een, uh, een van de weinige talks die Ilya Sutskever geeft, en dat is een van de cofounders van OpenAI en is nu met zijn eigen hele geheimzinnige lab SSI, uh, bezig. En hij geeft dus een talk over, uhm,

464
01:13:58.424 --> 01:14:08.804
over machine learning. En hoe, hoe, hoe, hoe werkt dat nou fundamenteel? Hoe leren nou computers van data? En daar zitten heel veel wiskundige principes aan ten grondslag.

465
01:14:08.864 --> 01:14:24.423
Maar dat, uh, dat idee wat Demis Hassabis noemt over Gene, Genie 3, dat er een soort manifold is, dat, dat, dat, het, het, het concept dat als je iets, uh, wil beschrijven, een, een, een fenomeen,

466
01:14:25.524 --> 01:14:32.204
dan, dan kun je dat op, op sommige manieren alleen heel omslachtig doen en op andere manieren kan je dat heel efficiënt doen.

467
01:14:32.264 --> 01:14:38.084
Dus zeg maar, hoe je iets gaat beschrijven bepaalt een beetje hoeveel, hoeveel tekens je nodig hebt.

468
01:14:38.624 --> 01:14:50.744
En het idee is dus dat als je in een bijvoorbeeld een C++ code een physics engine gaat bouwen, heb je heel veel code nodig om te beschrijven hoe de hele fysieke werkelijkheid gaat werken.

469
01:14:50.754 --> 01:14:55.484
Maar dan is eigenlijk de conclusie dat je het niet moet gaan schrijven in C++ code.

470
01:14:55.524 --> 01:15:06.574
Je moet op een andere manier de essentie, zeg maar de, de, de essentiële, uh, informatie, uh, gaan beschrijven op een manier die veel beter past bij het fenomeen.

471
01:15:06.964 --> 01:15:17.744
Dus dat is het idee dat je, zeg maar, een soort van fit hebt tussen waar je iets mee beschrijft en wa-wat je beschrijft. En dat daar een hele grote mismatch in kan zitten waardoor je heel veel nodig hebt.

472
01:15:17.784 --> 01:15:28.864
Bijvoorbeeld het, het platte gezegde van: een foto zegt meer dan duizend woorden. Uhm, het maakt gewoon uit welk medium je kiest als het ware. En ik denk dat wat die modellen laten zien is dat er

473
01:15:29.764 --> 01:15:38.064
een manier is om, uh, om in die modellen dus een efficiënte beschrijving te vinden voor fenomenen. En dat zie je dus terug tussen al die domeinen.

474
01:15:38.084 --> 01:15:49.024
Dus aan de ene kant is het tekst, dus dan is het codeconcepten en dergelijke. Daar wordt dan uiteindelijk in dat model, uh, krijgen ze voor elkaar om efficiënt, uh, redeneren over logicaproblemen in software.

475
01:15:49.444 --> 01:15:54.564
Maar je ziet het dus ook in bedrijven zoals Cradle in Nederland, biotechbedrijf met proteïne folding.

476
01:15:54.944 --> 01:16:03.964
Dat je, uh, biologische fenomenen, d-daar kan ook een soort efficiënte beschrijving gevonden worden in, in die, in die modellen, uh, in de gewichten van die modellen.

477
01:16:04.564 --> 01:16:15.784
En, uh, als je dan kijkt naar die Veo modellen en Genie, dan zie je dat in het visuele domein dat daar ook een soort, met, dus de natuurkundige interactie, dat dat ook efficiënt in die modellen gestopt kan worden.

478
01:16:15.884 --> 01:16:24.064
Nou, of het echt efficiënt is, daar kan je natuurlijk nog vragen bij stellen, want het zijn heel veel parameters als het ware, maar het wordt in ieder geval geleerd van de data.

479
01:16:24.184 --> 01:16:34.364
Dus het is misschien niet per se efficiënt in die zin, maar het is wel te leren van de data. Efficiënt genoeg dat het geleerd kan worden van de finite samples die ze laten, laten zien.

480
01:16:34.403 --> 01:16:42.364
Bijvoorbeeld Veo 3 is getraind op waarschijnlijk heel YouTube, maar heel YouTube is nog steeds best weinig. Het is alleen YouTube, alleen YouTube-video's.

481
01:16:42.884 --> 01:16:53.584
Dus, dus, dus, dus dit is een zo'n soort van: wat kan je leren van data en hoe kan je dat, hoe kan je dat extraheren? Het dikste zou zijn, zeg maar- Het lijkt dus weinig limieten te hebben.

482
01:16:54.164 --> 01:17:05.444
Ja, ik denk als, als je als voorbeeld kijkt naar, stel dat je een, uh, een stuk ambient muziek hebt, uh, van een minuut, hè, dus gewoon een beetje, uh, Brian Eno-achtige vibe music van een minuut.

483
01:17:05.504 --> 01:17:15.884
Die sla je dan op in vlak, zeg maar, dus dat is dan lossless. Voor mij is dat ongeveer 10 MB per minuut. Dan zeg ik: oké, we gaan iets van compressie doen. Pak je MP3, classic MP3 algoritme van lang geleden.

484
01:17:16.264 --> 01:17:26.784
Dan kom je op een MB per minuut, hè, dus tien keer zo klein. Maar waarschijnlijk in de, het is het, uh, uh, een beetje die, die community die van die kleine demo scene code maakt.

485
01:17:26.824 --> 01:17:35.444
Hè, die probeert dan in 1 KB een, uh, uh, Flappy Bird te bouwen. Die zou waarschijnlijk zeggen: het is mij gelukt om ambient music te genereren, gewoon met waveforms- Ja.

486
01:17:35.624 --> 01:17:42.584
In één regeltje JavaScript van, nou ja, weet ik veel hoeveel tekens. En het is natuurlijk, en daar komt dan ongeveer dezelfde muziek uit, hè.

487
01:17:42.664 --> 01:17:49.084
Dus als je, als het jou lukt om het generatieve algoritme achter die data te vinden als het ware.

488
01:17:49.144 --> 01:18:04.204
En in dit geval, wat een beetje mogelijk aan het gebeuren is met Genie 3, is ook nog eens omdat er zoveel parallellen zijn tussen patronen in het universum, namelijk, uh, het lichtspectrum en het geluidsspectrum en al die spectra hebben een soort zelfde fractal-achtige patronen erachter zit.

489
01:18:04.224 --> 01:18:07.964
Ik maak hele grote- De universaliteit van elektromagnetisme et cetera.

490
01:18:08.024 --> 01:18:18.204
Is natuurlijk de hoop van de wiskundigen dat een soort theory of everything gevonden wordt waardoor je met één regel code het hele universum kan genereren. [lacht] Maar dit is een beetje waar jij over praat, toch?

491
01:18:18.224 --> 01:18:23.284
Hè, dat je zegt van: het is ook een beetje het idee van intelligence is compression, compression is intelligence.

492
01:18:23.644 --> 01:18:30.384
Het feit dat jij complexe patronen kan weergeven in steeds minder informatie, dat is eigenlijk een vorm van intelligentie.

493
01:18:30.424 --> 01:18:39.378
Dat is wat mensen doen.Ja, het is vooral een signaal denk ik, want het is zeg maar, uhm, kan je, die modellen worden niet groter terwijl ze trainen, hè.

494
01:18:39.388 --> 01:18:49.388
Die, die modellen die hebben één formaat en die moeten dat formaat blijven. En het idee is dat, je kan er heel veel d-doorheen pompen. Ja, staat die parameterlimiet al vanaf het begin? Ja. Oh, wauw.

495
01:18:49.508 --> 01:18:58.728
Ze zijn gewoon één formaat en ze gaan dan gewoon informatie continu krijgen. Ja. En het is niet alsof ze opzwellen. Ze blijven exact hetzelfde formaat, maar ze gaan gewoon steeds beter presteren.

496
01:18:58.788 --> 01:19:05.448
Dus als je, uh, een hele grote hoeveelheid data hebt en je kan die, uh, je voert die er continu doorheen.

497
01:19:05.808 --> 01:19:14.188
Op een gegeven moment is het idee dat ie alles wat je er doorheen hebt gevoerd, de training data die die heeft gezien, dat hij die perfect zou kunnen voorspellen. Dat is wat je hoopt.

498
01:19:14.248 --> 01:19:23.928
En in de praktijk, omdat die modellen zo groot worden, die datasets zo groot worden, behaal je niet meer perfecte begrip. En dan zie je dus dat die modellen een soort absorptielimiet hebben.

499
01:19:23.968 --> 01:19:28.448
Dus dan, uh, je kan er nog meer ingooien, maar ze worden niet beter in dat voorspellen.

500
01:19:28.948 --> 01:19:41.348
En, uh, een van de belangrijkste, uh, manieren waarop die labs hebben opgeschaald is door steeds beter verschillende data te vinden om er doorheen te voeren. En dan zie je dat er, dat ie wel weer zeg maar omlaag gaat.

501
01:19:41.388 --> 01:19:45.608
Dus de kwaliteit van data die je erin stopt, die bepaalt ook hoe laag die als het ware kan gaan.

502
01:19:46.548 --> 01:19:59.848
En ik denk dat dat mechanisme, dus dat fundamenteel leeralgoritme waarbij je, maar, aan de hand van data, uh, die patronen kan, uh, extraheren. Daar gaan we denk ik steeds beter in worden.

503
01:20:00.008 --> 01:20:05.268
En terwijl we ook meer data kunnen verzamelen en betere kwaliteit data kunnen verzamelen.

504
01:20:05.288 --> 01:20:11.868
Want als je kijkt naar de, de, de, de, de snelheid waarmee videocontent wordt geüpload naar het internet, dat groeit nog steeds allemaal.

505
01:20:12.188 --> 01:20:20.068
Dus w-onze data exhaust als het ware neemt niet heel erg af omdat we en steeds digitaler leven. Dus we hebben ve-ste-steeds meer, uh, voetsporen.

506
01:20:20.628 --> 01:20:26.508
En omdat a-alle instrumenten om op te nemen, die zijn ook steeds hoger in kwaliteit. Elk, uh, elke iPhone heeft weer een betere camera.

507
01:20:26.968 --> 01:20:41.028
Al die camerabeelden hebben veel meer informatie en zo kan een, een, een, een Genie 12, uh, kan natuurlijk van de, de 900 megapixel videocamera van iPhone, kan die op een gegeven moment wel die, die echte physical, uh, dingetjes, uh, extraheren.

508
01:20:41.588 --> 01:20:48.568
Dus, dus dat is toch een mee, want dan, dan, nou ja, dan heb je gewoon heel scherp water, weet je wel [lacht]. En dan heb je gewoon heel scherp water.

509
01:20:48.768 --> 01:21:01.308
Hé, laten we het nog heel even hebben over, uh, de open source modellen van OpenAI. Uhm, want een van de dingen die ik, uhm, tegenkwam is, uh, GPT, uh, OSS zoals ze heten, uh, is just Phi-5.

510
01:21:01.488 --> 01:21:10.048
En dat ging erover dat je de Phi-modellen van Microsoft hebt, die allemaal opvallen omdat ze getraind zijn op sec synthetische data, dus enkel op synthetische data.

511
01:21:10.448 --> 01:21:24.048
En de, de, uh, de roddel, de rumor, whatever, hoe we dit willen noemen, is nu een beetje in de community dat OpenAI ervoor gekozen heeft om de open source series van GPT ex-exclusief te trainen op synthetische data om gedoe te voorkomen.

512
01:21:24.088 --> 01:21:34.248
Want als je natuurlijk zo'n model uitbrengt en met dat model kan je bewijzen in de rechtszaal dat ze rommel hebben gebruikt, dat, dat er de, dat er de opdracht gegeven is intern: train dat maar allemaal op open source.

513
01:21:34.428 --> 01:21:41.288
Heel even voor de luisteraar, mocht je het niet hebben meegekregen: OpenAI heeft dus nu, uh, eindelijk open [gniffelt] modellen, open weights, uh.

514
01:21:41.348 --> 01:21:44.928
Dus dat houdt in dat de gewichten te downloaden zijn en te draaien zijn op je eigen machine.

515
01:21:45.508 --> 01:21:59.668
Uh, de data die erin gegaan is hebben we niet, dus het is niet volledig open source, maar in ieder geval de belofte om modellen uit te brengen zoals we dat gewend zijn van bijvoorbeeld DeepSeek-R1 of de Llama-series vanuit Meta, is er nu ook een GPT OSS-serie vanuit OpenAI.

516
01:21:59.708 --> 01:22:08.068
Hoe kijk jij daarnaar, Rick? Wat, wat was je eerste reactie toen die uitkwamen? Valt het tegen of was je niet verbaasd? Of wat is je take? Uhm,

517
01:22:10.168 --> 01:22:13.628
kijk, dit is ook een beetje zo'n vraag van, dus ik denk dat er een kern van waarheid in zit.

518
01:22:13.688 --> 01:22:25.188
Wat, wat, wat een beetje de vibes als je het model gebruikt, uh, wat, wat voor gevoel je daarvan kan krijgen, is dat het een hele klinische dataset is waar die op getraind is.

519
01:22:25.948 --> 01:22:31.148
Dat wil niet zeggen dat de data waarop die getraind is— ik heb even voor de grap, uh, net, uh, de vraag gesteld: what is React?

520
01:22:31.288 --> 01:22:43.128
Dat is zo'n, uh, programmeerframework aan GPT OSS, uh, op Grok geweest natuurlijk, uh, gevraagd van wat ie dan zegt en, uh, daar geeft ie gewoon een supernuttig antwoord, weet je wel.

521
01:22:43.568 --> 01:22:55.128
Dus, uh, de informatie die, uh, synthetisch geproduceerd is, is nog steeds public webdata voor een heel groot deel. En het is gewoon vooral heel erg opgeschoond.

522
01:22:55.168 --> 01:23:01.488
Dus ik denk dat ze, ze hebben lang gedaan over het release van een open source model, omdat inderdaad een open source model veel scrutiny met zich meebrengt.

523
01:23:02.008 --> 01:23:24.688
En ik denk dus dat ze de sweetspot hebben gevonden van eigenlijk wat, wat, wat al eerder, zeg maar, de wens was van het publiek en de, en vaak ook, uh, overheden met regelgeving van hoe die labs modellen maken, dat ze veel gedetailleerder nagaan: wat stoppen we nou eigenlijk precies in de pre-training, uh, dataset en wa-waar trainen we daarna nog op verder op door?

524
01:23:25.288 --> 01:23:37.468
En ik denk dat je nu het resultaat ziet van een heel, uh, klinische benadering van het trainen van een model. En dan zie je toch dat, dat, ja, dat het een beetje het rauwe randje eraf is.

525
01:23:38.008 --> 01:23:50.168
En, uh, dat is ook, uh, een beetje het stukje creativiteit of een soort ve-verrassingseffect, of dat het met nieuwe ideeën kan komen. Een beetje die long tail, dat, dat lijkt er een beetje uit, uit in de vibes.

526
01:23:50.468 --> 01:24:01.388
Ze zijn een beetje saai. Ja, en dat is misschien ook gewoon de, het resultaat van als je dus, uhm, je moet beperken tot een subset van data waar je niet mee in de problemen komt.

527
01:24:01.818 --> 01:24:18.788
En dat is eigenlijk al wat er heel lang geroepen wordt, is dat als er, als er dan discussie is over het juridische punt van, uhm, is het fair use voor een modelmaker, voor een modelbouwer om te trainen op copyrighted content die online staat, maar wel publiek online staat, dus iedereen kan het gewoon bekijken, maar er heerst wel copyright op.

528
01:24:18.828 --> 01:24:25.528
Is het fair use? Is het transformative genoeg? En ik denk dat OpenAI nu heeft gewoon gezegd: we gaan aan de veilige kant zitten en dan zie je wat er gebeurt.

529
01:24:26.108 --> 01:24:38.408
Hè, dus we weten niet of dat helemaal precies zo waar is, maar ik denk dat van de kern van dat idee dat dat wel, uh, uh, standhoudt. Dat gezegd hebbende, ik heb het model gebruikt voor, voor vragen

530
01:24:39.368 --> 01:24:49.818
en, uhmOm, om gewoon een gevoel te krijgen bij wat kan het. En o-op het moment dat je het model combineert met nieuwe data in de context window.

531
01:24:49.938 --> 01:24:56.438
Dus je gebruikt tool calling om allemaal informatie op het internet op te zoeken via search engines en daarna krijg je een antwoord.

532
01:24:57.078 --> 01:25:04.118
Dan zit die soort van, uh, dynamische, echte unieke nieuwe informatie, die voer je er zelf in.

533
01:25:04.738 --> 01:25:14.218
Dus het model is heel geschikt denk ik voor systemen waarbij je zelf verantwoordelijk bent voor het, het, het, het invullen van die context window. En dat is belangrijker dan ooit bij dit model.

534
01:25:14.818 --> 01:25:24.518
Het kan heel goed met die content die je het geeft interessante dingen doen, maar zal het in zijn weight hele vette dingen hebben? Ja. Minder. Precies.

535
01:25:24.558 --> 01:25:29.768
Het is een discussie van: moet een taalmodel eigenlijk een soort van kennis hebben of kennis over patronen?

536
01:25:29.938 --> 01:25:46.577
Oftewel liever wat meer intuïtie over patronen om als kennis geleverd wordt iets juist te kunnen doen met die kennis dan heel veel achtergrondkennis, uh, om, uh, vervolgens een soort, uh, heel Wikipedia eigenlijk er ook nog in te hebben zitten, wat heel inefficiënt is en ook nog eens gedoe kan opleveren.

537
01:25:46.657 --> 01:25:57.798
Wikipedia is slecht voorbeeld, want daar zijn voor mij minder vragen over. Maar de hele New York Times herladen. De juiste take, dat is de take. En, en je ziet het natuurlijk de, de gast die, uh, of de, de, de, de,

538
01:25:58.928 --> 01:26:10.418
de, de persoon die verantwoordelijk was voor Phi is naar OpenAI gegaan en er zal dus vast een sterke, sterke hand van hem in, uh, hebben gezeten. Dus ik denk dat- Ik bedoel dat trouwens niet per se als een negatieve, hè.

539
01:26:10.518 --> 01:26:20.078
Ik bedoel, je kunt ook zeggen- Die Phi-modellen waren wel heel negatief ontvangen over het algemeen. Ja, klopt. Ja, goed, dat, dat, er zit-- ik bedoel het is geen compliment om te zeggen je bent Phi-5, zeg maar. Nee.

540
01:26:20.118 --> 01:26:33.278
Maar tegelijkertijd, als de afspraak is: we laten deze modellen heel goed zijn in, uh, kunnen werken met, uh, ja, just in time context. Hè, dus de informatie wordt net op tijd toegevoegd aan de context window.

541
01:26:33.878 --> 01:26:43.338
Uhm, en, uh, voor de rest is het gewoon iets wat weinig snapt of wijn-weinig weet, maar veel snapt. Laat ik het dan zo zeggen, dat dat misschien best wel een interessante weg is om in te slaan.

542
01:26:43.378 --> 01:26:49.757
Om tot het allerkleinste, meest efficiënte of een heel efficiënt klein model te zijn die niets weet, maar heel veel snapt.

543
01:26:49.798 --> 01:27:00.858
Ja, want er is wel veel kritiek en het is echt een soort, uh, paradox of een soort k-fundamenteel conflict waar mensen nog niet over uit zijn van: kun je intelligent zijn in een vacuüm, zeg maar.

544
01:27:00.878 --> 01:27:11.658
Kan je alleen maar een soort axioma in je hoofd hebben? D-d-d-het is gewoon, kan je het, kan je, kan je intelligentie lostrekken van al die feitenkennis? Of is heel veel van die feitenkennis ook nodig?

545
01:27:12.098 --> 01:27:24.358
En ik denk dat, uhm, mensen een beetje proeven dat zo'n model wat op de manier getraind is zoals al die andere modellen getraind worden, maar met minder kennis voelt out of the box n-minder nuttig.

546
01:27:25.078 --> 01:27:35.998
En dat, dat is denk ik een redet, redelijk goede conclusie. Maar dit model is ook extreem agentic in de zin van het kan tool calling doen en nog meer tool calling en nog meer tool calling en daar dan chocola van maken.

547
01:27:36.698 --> 01:27:44.978
En dus denk ik dat als je het op de juiste manier vasthoudt. [lacht] If you hol-, if you're holding it wrong, it will be bad. If you're holding it right, it could do pretty useful stuff.

548
01:27:45.338 --> 01:27:52.818
En dat is een beetje de conclusie, denk ik. Voordat we afronden, want we hebben best wel wat gezonden al naar de mensen. Jij zei net even, uh, trots: het draait op Groq.

549
01:27:52.858 --> 01:28:04.378
Groq met een q, hè, want dat was nog een ding waar ik me eigenlijk minder, waar ik minder bij stil had gestaan is, is natuurlijk het feit dat als OpenAI die modellen releaset met een license erbij, Apache 2 uit mijn hoofd- Ja.

550
01:28:04.778 --> 01:28:07.978
Uh, waardoor je dit ook gewoon commercieel kunt inzetten.

551
01:28:08.138 --> 01:28:26.838
Dat de partijen zoals Groq, Cerebras, uh, nou ja, en anderen trouwens Bedrock, Amazon, noem ze allemaal maar op, dat die ook allemaal in hun rijtje waar nu DeepSeek, Llama en Qwen stond ineens ook GPT-OSS staat en je, want dat is nog het allerbelangrijkst, die gestoorde inference speed krijgt met 1.000 tokens per seconde.

552
01:28:26.898 --> 01:28:35.218
Want ik moet zeggen, het eerste wat ik deed was Groq in, in een IDE koppelen en kijken wat er gebeurt als je agentic gaat programmeren, als de tokens je gewoon om de oren vliegen.

553
01:28:35.258 --> 01:28:42.958
En ik, dat vond ik wel even een momentje dat ik dacht: ah, snelheid is dus blijkbaar ook nog wel een variable waar, uh, waar we nog kunnen winnen met elkaar.

554
01:28:43.638 --> 01:28:54.058
Ja, en dat, dat is, uh, w-waarbij je ziet dat het ecosysteem zich op meerdere assen ontwikkelt. Je hebt, uh, inference waarbij er partijen zijn die niet zozeer bezig zijn met de modellen.

555
01:28:54.538 --> 01:29:02.358
En het bedrijf waar ik voor werk, Groq, dat, die is daar mee bezig. Maar er zijn heel veel partijen, dus er is heel veel concurrentie om die inference markt goed te bedienen.

556
01:29:02.918 --> 01:29:13.838
En als er open source modellen zijn, dan zie je dat, ja, dan kan je je helemaal specialiseren op puurheid. Hoe draai je die modellen het beste? En dan kan je dingen doen die OpenAI gewoon niet voor elkaar krijgt.

557
01:29:13.858 --> 01:29:24.878
Zoals wij runnen nu, ik, di-deze what is React query runt met 1.200 tokens per second en GPT-OSS haalt voor duidelijkheid 60% op die SWE-bench verified.

558
01:29:25.758 --> 01:29:35.578
Dat is, ja, minder dan 75%, maar dat is nog steeds- Een prima sparringpartner. En prima voor heel veel programmeertaken. Ik bedoel, als jij simpele dingen programmeert, dan heb je er heel, heel veel aan.

559
01:29:35.998 --> 01:29:46.198
Dus ja, ik denk dat, uhm, i-ik denk dat het voor OpenAI een heel interessant, uhm, strategisch ding is geweest en het is heel multidimensionaal.

560
01:29:46.218 --> 01:29:50.238
Ik denk dat mensen willen liever voor OpenAI werken nu er ook echt een open model is.

561
01:29:50.358 --> 01:30:03.038
Uh, er zijn, uhm, er zijn ook wel, zeg maar geopolitieke dingen aan de hand met als China heel erg de overhand krijgt met, met innovatie doordat zij de als enige echt goede dingen open sourcen.

562
01:30:03.158 --> 01:30:10.058
Uhm, wat doet het dan met de zwaartekracht van het ecosysteem? Wat zijn de soort second order gevolgen van dat soort, van zo'n realiteit?

563
01:30:10.738 --> 01:30:17.618
En dus ik, ik kan niet precies spreken voor waarom OpenAI dit model gereleased heeft, maar ik vind het wel een indrukwekkend model en het is echt nuttig.

564
01:30:17.738 --> 01:30:27.638
Het is gewoon, het is niet een, het is niet een soort fake release. Nee, ik snap hem. Wat een beetje geroepen werd, uh, net na de release van dit. Niemand wilde dit, maar ze moesten of zo.

565
01:30:27.738 --> 01:30:32.818
Terwijl, daar hebben ze wel veel moeite voor gedaan als het de moeite was. Dat klopt niet helemaal met wat er nu uitgebracht is.

566
01:30:33.158 --> 01:30:41.278
En verwacht je dan ook, nog een laatste vraag, uhm, dat hier net als bij de Llama-serie en andere modellen een soort van heel ecosysteem gaat ontstaan.

567
01:30:41.378 --> 01:30:57.090
Allemaal fine tunes en a-- ik bedoel, tuurlijk zijn er al allemaal quants gemaakt en dat zie ik al nu gebeuren, hè, maar dat, dat er echt een soort, uh, 10%Beter presterende versie gemaakt wordt door een groep die open source ontwikkelaars die het model doorpakken Dat denk ik wel.

568
01:30:57.450 --> 01:31:07.750
Ik denk echt dat er op grote schaal, want de, de, de soort technologische ecosystemen, de, echt de, de frameworks voor training en voor reinforcement learning, dat is ook allemaal een stuk volwassener.

569
01:31:08.470 --> 01:31:18.670
Uh, dus er zijn nu echt gewoon mensen die pluggen gewoon hun bestaande training, uh, infrastructuur die gewoon konden zeggen: ik heb een model en train dat model nu op mijn use case.

570
01:31:19.430 --> 01:31:27.970
Veel meer mensen hadden al zo'n harnas traas, klaarstaan nu dan ooit tevoren. En die kunnen zo dit open source model pakken en kijken: even kijken hoe goed dit op OpenAI doet.

571
01:31:28.010 --> 01:31:32.430
En ik denk dat daar ga je wel zien dat mensen door kunnen bouwen op deze modellen.

572
01:31:33.210 --> 01:31:43.450
Maar nogmaals dan, dat vereist als je echt die modellen wil aanpassen voor je use case, dat vereist best wel veel expertise en data en, en dat is, ja, er is wel gewoon een beter model wat je ook kan krijgen.

573
01:31:43.470 --> 01:31:59.530
Dus ik denk dat je, u-het g-, het grootste deel van de mensen die kijkt gewoon kan ik met prompting, met gewoon mijn vraag op de juiste manier stellen aan het open source model, gewoon uit de voeten met dit model voor bepaalde features in mijn software of voor bepaalde code taken die ik doe, die ik gewoon het liefst zo goedkoop mogelijk wil hebben.

574
01:32:00.650 --> 01:32:15.650
En er zijn een aantal mensen die gaan kijken naar hoe kan ik dat model nog, nog verder pushen in de capability, zeg maar voor een, een, een meer spe-gespecialiseerde use case waar ze unieke data tot hun beschikking hebben om het op te finetunen, op reinforcement tuning of zo te doen.

575
01:32:15.770 --> 01:32:19.810
Uhm, maar dat is voor een selecte groep wegge-weggelegd denk ik.

576
01:32:20.130 --> 01:32:32.510
De meeste mensen kunnen of gewoon out of the box dit gebruiken en, uh, het is goed out of the box en, uh, of, of kijken naar nog, uh, nog betere modellen die dan niet open source zijn. Vet man!

577
01:32:32.550 --> 01:32:43.070
Dank je wel voor, uhm, alles. Het was een hoop. Uh, ik denk als je een graph zou laten tekenen van wat we aangeraakt hebben, dat het best wel [lacht] best wel veel is. Uhm, ja, laten we kijken man.

578
01:32:43.110 --> 01:32:51.610
Als er, als er een Gemini 3.8, ik bedoel die komt. Ja, zeker. En als het groot is, uhm, zou ik je graag, uh, nog eens erbij trekken man. Ja, ik ben heel benieuwd.

579
01:32:51.650 --> 01:33:02.910
Ik kijk met, uh, met heel veel interesse naar alle releases die er dit jaar nog gaan, uh, plaatsvinden, want het is, uh, echt fascinerend. Thanks man! Spreek je. Hoi! Hoi.

580
01:33:06.450 --> 01:33:19.360
[afsluitend muziek]
