WEBVTT

1
00:00:00.220 --> 00:00:09.160
Welkom bij AI Report, de Nederlandse podcast over kunstmatige intelligentie waar we uitzoeken welke invloed AI heeft op ons werk, ons leven en de samenleving.

2
00:00:09.600 --> 00:00:19.000
Met deze week: Anthropic lanceert Claude Opus 4.7 en een compleet nieuw design product: Claude Design, wat zichtbaar was op de beurs voor zowel Figma als Adobe.

3
00:00:19.520 --> 00:00:27.100
Daarnaast kan Anthropic sinds kort vragen om je paspoort of rijbewijs wanneer ze twijfelen over je leeftijd. Ook OpenAI heeft niet stilgezeten.

4
00:00:27.140 --> 00:00:36.700
Het breidt Codex uit naar een super app en komt met een nieuw AI-model: GPT-Rosalind, dat de ontwikkeling van medicijnen moet gaan versnellen. Dan nieuws vanuit Meta.

5
00:00:37.280 --> 00:00:50.160
Een interne memo laat zien dat er een tool is ontwikkeld die muisbewegingen en toetsenaanslagen van werknemers gaat vastleggen om AI agents te voeden, die dan weer de taken van deze medewerkers gaan overnemen in de toekomst.

6
00:00:50.500 --> 00:01:03.660
Verder interview ik Thomas Kluijters, die destijds aan de wieg stond van Juvoli en nu oprichter is van Resonate, een Nederlands AI-lab dat speech-to-text modellen op maat maakt. Dat en meer in AI Report. Veel plezier!

7
00:01:10.540 --> 00:01:25.880
[muziek] Anthropic heeft deze week zijn nieuwste AI-model gelanceerd: Claude Opus 4.7. De opvolger van 4.6 presteert volgens het bedrijf vooral beter bij complexe taken die eerder voortdurend toezicht vergden.

8
00:01:25.940 --> 00:01:36.480
Opvallend is wat Anthropic bewust niet heeft gedaan. Een paar weken geleden vertelden we over Mythos, een AI-model dat duizenden ernstige beveiligingsfouten vond, maar nog te gevaarlijk is om vrij te geven.

9
00:01:36.940 --> 00:01:49.920
Bij Opus 4.7 heeft Anthropic geëxperimenteerd met het doelbewust afzwakken van die cyberveiligheidscapaciteiten. Het doel is om eerst te kijken hoe dit werkt op Opus, om vervolgens Mythos breder beschikbaar te maken.

10
00:01:50.680 --> 00:01:59.400
Een dag na de lancering van Opus 4.7 kwam Anthropic met Claude Design, een nieuw product waarmee je presentaties, prototypes en marketingmateriaal kunt maken.

11
00:01:59.720 --> 00:02:12.920
Door te beschrijven wat je nodig hebt, kun je met Claude Design een eerste versie bouwen van bijvoorbeeld een website, marketingmateriaal, noem maar op, en daarna kan je onder meer kleur, lay-out verfijnen en je design exporteren naar PowerPoint, PDF, Canva of losse HTML-bestanden.

12
00:02:13.560 --> 00:02:24.080
Bij OpenAI zaten ze ook niet stil deze week. Programmeertool Codex kreeg een forse update en positioneert zich nu als een breder productiviteitsprogramma, vergelijkbaar met Anthropic's Cowork.

13
00:02:24.460 --> 00:02:33.700
De belangrijkste toevoeging is dat Codex je computer kan bedienen en ook op de achtergrond. Dus terwijl jij gewoon doorwerkt, is Codex op de achtergrond jouw programma's aan het bedienen.

14
00:02:34.340 --> 00:02:39.860
OpenAI claimt dat 80% van het eigen personeel Codex gebruikt. En dat is niet enkel programmeurs.

15
00:02:40.740 --> 00:02:49.040
De tweede grote aankondiging van OpenAI is GPT-Rosalind, vernoemd naar Rosalind Franklin, de wetenschapper die met haar onderzoek de structuur van DNA onthulde.

16
00:02:49.080 --> 00:02:56.140
Het model is dan ook specifiek toegelegd op de biowetenschappen. Het ontwikkelen van een nieuw medicijn duurt nu gemiddeld 10 tot 15 jaar.

17
00:02:56.160 --> 00:03:05.900
GPT-Rosalind moet dat verkorten door onderzoekers te helpen bij het doorploegen van wetenschappelijke literatuur en het analyseren van moleculaire data. Dan bijzonder nieuws vanuit Meta.

18
00:03:06.480 --> 00:03:27.840
Een interne memo laat zien dat binnen Meta de computers van werknemers gemonitord gaan worden op zowel muisbewegingen als toetsenaanslagen om computer use models, oftewel modellen die computers kunnen gebruiken, te trainen om uiteindelijk agents te hebben die grote stukken en grote delen van de rollen van de mensen binnen Meta kunnen overnemen.

19
00:03:28.740 --> 00:03:35.880
De computer use models zijn sowieso iets wat aan het groeien is. OpenAI lanceerde een functie genaamd Chronicle in zijn Codex app.

20
00:03:36.740 --> 00:03:51.160
Uh, met die Chronicle functie kun je eigenlijk de hele dag jouw gebruik op de computer laten monitoren door Codex, waardoor de memory functie, die normaal dus een stukje geheugen over jou bijhoudt, verrijkt wordt door wat jij die dag op jouw computer gedaan hebt.

21
00:03:51.800 --> 00:04:06.520
Eigenlijk zoiets als de Microsoft Recall fe-feature die Microsoft ironisch genoeg gerecalled heeft. Goed, voor de nieuwsbrief hebben we zowel Claude Opus 4.7, Claude Design en de nieuwe ChatGPT Image Generator getest.

22
00:04:06.560 --> 00:04:18.899
We vertellen je wat je er allemaal mee kunt en hoe je ze kunt inzetten voor je alledaagse taken op werk. Ga hiervoor naar AI Report.nl. Het is vakantie en dat betekent dat ik vaak lange, complexe interviews ga doen.

23
00:04:19.240 --> 00:04:32.340
Het is weer zover. Ik heb deze week Thomas Kluijters, voorheen van Juvoli. Hij was hier al eerder in de show. Nu heeft hij het AI-lab Resonate opgezet, waar ze op maat gemaakte speech-to-text modellen maken.

24
00:04:32.380 --> 00:04:40.680
Dus dat zijn modellen die kunnen luisteren naar audio en daar tekst uit kunnen halen. Ik praat met Thomas over, uh, soevereiniteit.

25
00:04:40.840 --> 00:04:56.390
Ik praat met hem over hoe je traint, over hardware, uh, over waarom dit soort op maat gemaakte modellen interessant zijn, hoe ze zich verhouden tot de modellen van Mistral, uhm, wat sowieso het idee is van AI-labs binnen de EU en binnen Nederland.

26
00:04:56.900 --> 00:05:08.840
Waarom hij hier blijft en niet is verhuisd naar de US. Al met al een interessant interview. En zoals altijd, als het eventjes te veel is, zet hem even lekker op pauze, loop een stukje buiten en kom dan weer terug.

27
00:05:09.340 --> 00:05:09.900
Veel plezier.

28
00:05:14.120 --> 00:05:27.360
[muziek] Ik zit op, uh, Artificial Analysis.AI te kijken naar de Artificial Analysis In-Analysis Intelligence Index en dan zie ik Mistral-Small 4 ergens bijna van het beeld afvallen.

29
00:05:28.260 --> 00:05:35.540
En daarvoor zie ik eigenlijk alleen maar Amerikaanse en Chinese modellen. Ik maak me hier een beetje zorgen om, merk ik.

30
00:05:35.580 --> 00:05:49.420
Hoe zit jij een beetje in dit verhaal van: één Europees model niet in de kopgroep van Artificial Intelligence? Ik denk dat het vooral vervelend is voor mensen die in Europa wonen.

31
00:05:49.860 --> 00:06:02.380
Uh, je merkt vooral dat de nieuwere modellen vaak wat minder goed zijn in Europese talen. Uhm, vandaag toevallig heb wat experimenten gedaan waar we voor het Gamma 4 nemen van Google en die vergelijken met het Qwen 3.6.

32
00:06:02.800 --> 00:06:11.040
We zien dat Qwen 3.6 ontzettend slim is, maar de taligheid van Qwen 3.6 zit niet precies op het niveau van een GPT-4o.

33
00:06:11.200 --> 00:06:19.432
En dan zien we dat Gamma 4Hoewel misschien niet even slim als een Qwen 3.6, toch die taligheid van Nederlands heel goed kan. En wat bedoel ik dan?

34
00:06:19.532 --> 00:06:25.172
Uhm, bijvoorbeeld als ik de vraag stel: nou, welke termen zijn nou relevant voor een gesprek tussen een arts en een patiënt?

35
00:06:25.412 --> 00:06:39.292
Dan zien we dat bijvoorbeeld pijnstilling een heel relevante term is volgens Qwen 3.6, maar ook praat dokter en huisdokter. En Gemma, die denkt dan toch wel: ja, ibuprofen, paracetamol.

36
00:06:39.792 --> 00:06:50.032
En dat vond ik wel interessant, want, ja, je zou eigenlijk verwachten dat een superintelligent model zoals Qwen 3.6 die termen, uh, supergoed en supersnel zou kunnen vinden.

37
00:06:50.652 --> 00:07:06.272
Maar toch zien we dat eigenlijk een Mistral of een, in dit geval Gemma 4, die toch wel wat meer gefocust zijn op, nou, general purpose, uh, use cases, zien we dat de Europese, en ik zou niet zeggen dat Gemma per se Europees is, maar Mistral zien we ook dat het best wel goed is in die taligheid.

38
00:07:06.912 --> 00:07:15.212
Dus eigenlijk de top 40 die ik er nu bij heb gepakt is niet per se het hele verhaal omdat het een intelligence index is. En jij zegt: ja, intelligence in welke taal?

39
00:07:16.112 --> 00:07:22.352
Ja, nou ja, je zou kunnen zeggen dat intelligence, ja, de benchmarks natuurlijk, hoe wordt die nou gemeten? Ja, dat is natuurlijk een beetje.

40
00:07:22.952 --> 00:07:29.392
Op dit moment, uh, is wel bewezen dat benchmarks niet altijd de leidende factor zijn in hoe slim of hoe goed een model is. Maar,

41
00:07:30.492 --> 00:07:39.332
uh, je hebt natuurlijk de benchmarks en je hebt de echte wereld en je merkt dat voor onze use cases een Qwen 3.6 gewoon niet genoeg is.

42
00:07:39.652 --> 00:07:47.112
En dit heb ik natuurlijk ook bij Juvely heel veel gemerkt, waar elke week er een nieuw model uitkwam en we, we hoopten van: oké, misschien is dit model wel heel goed.

43
00:07:47.232 --> 00:07:52.832
Of in bepaalde use cases bij, bij Juvely, namelijk het samenvatten van, van een gesprek tussen een patiënt en een arts.

44
00:07:53.412 --> 00:08:05.472
En dan merk je toch dat, ja, uhm, ik kon nog wel, uh, herinneren dat, uh, we een nep consultatie hadden tussen, uh, een, een arts en een patiënt en die had dan, uh, uh, last van z-haar keel.

45
00:08:06.072 --> 00:08:18.292
En, uh, toen vroeg de arts, uh: ja, wat doe je dan? En, uh: nou, ik drink, uh, gemberthee. Uhm, en toen had, uh, Qwen 3.6 samenvat: geen gemberthee effect. En dat vond ik wel een hele mooie. Uhm,

46
00:08:19.272 --> 00:08:30.632
uh, hoewel deze modellen ontzettend goed zijn, uh, in misschien coding of instruction following voor bepaalde use cases zien we dat, ja, in de echte wereld dat, dat toch een beetje snijdt.

47
00:08:31.392 --> 00:08:44.212
Uh, en dan merken we wel dat de, de meertalige, uh, zoals inderdaad een, een Gemma 4, Mistral, uh, toch ontzettend goed zijn in, in juist de cases die voor ons belangrijk zijn.

48
00:08:44.652 --> 00:08:54.412
En wat is dan, kan je mij een beetje een idee geven tussen de, van de relatie tussen de benchmarks en de wereld? Of hoe jij die meemaakt, zeg maar, binnen jouw sector, binnen jouw werkveld?

49
00:08:55.052 --> 00:09:06.152
Ja, dus bij Juvely waar het heel erg om ging was bijvoorbeeld, uhm, je kan heel goed en precies weten wat er gebeurt in een gesprek, uh, als model.

50
00:09:06.312 --> 00:09:13.872
Je kan het heel goed beschrijven, maar kan je het ook heel goed opschrijven? Dus je kan het wel goed beschrijven. Zeg maar intern zie je wat er gebeurt.

51
00:09:14.302 --> 00:09:26.672
Het model blijkbaar, het, het, het, tot het detail toe kon het beschrijven wat er is gebeurd in het gesprek. Maar om dat vervolgens, uhm, te schrijven op een manier zoals we het willen lezen als, als persoon.

52
00:09:26.812 --> 00:09:34.972
Dus je bedoelt als je de, als het ware de gedachtegangen meeleest, denk je: ja, je hebt, je, je hebt goed door wat hier gaande is en dan vervolgens zegt: oké, nu heb je dat door.

53
00:09:35.312 --> 00:09:38.932
Schrijf het nou eens op, dan verloor je daar wat. Correct, ja.

54
00:09:39.312 --> 00:09:50.812
Dus we, we merken dat heel erg in, uh, ja, hoe het large language model, uh, uiteindelijk de output schrijft of, of als we dat in een bepaalde structuur willen zien, vooral in Europese talen.

55
00:09:51.392 --> 00:09:59.212
Uh, bij Resonate, uh, gebruiken we bijvoorbeeld heel veel verschillende talen, uh, dus, uh, van Frans tot Turks tot wat dan ook.

56
00:09:59.752 --> 00:10:18.132
En eigenlijk is onze bread and butter nu vooral Gemma 4 en, en in Mistral modellen, uh, en Qwen 3.6 laten we vooral gebruiken voor, uh, use cases waar je gewoon complexe beslissingen moet maken waar het niet zo heel erg uitmaakt wat je nou eigenlijk produceert, zolang je maar het juiste antwoord produceert.

57
00:10:18.162 --> 00:10:26.292
Maar dan noem je drie open modellen. Modellen die mensen kunnen downloaden, mee aan de gang kunnen. Ligt een beetje aan de licentie die erbij zit, maar goed, je kunt ze in ieder geval draaien op je eigen infrastructuur.

58
00:10:27.312 --> 00:10:32.952
Uhm, is het bewust dat je zegt: ik, dat is nou eenmaal de, uh, het cluster met modellen dat ik kan gebruiken.

59
00:10:33.452 --> 00:10:41.752
Of zeg je: zelfs, uh, die kleinere modellen, die open modellen zijn op bepaalde punten krachtiger dan de gesloten frontier models.

60
00:10:42.372 --> 00:10:46.472
Of ben je, heb je een bewuste strategie om te zeggen: wij willen gewoon kiezen uit open modellen.

61
00:10:47.332 --> 00:10:55.172
Waar het voor ons altijd op neerkomt is dat we eigenlijk intern de modellen finetunen, uh, als we large language models gebruiken voor, voor onze use cases.

62
00:10:55.832 --> 00:11:05.232
Dus denk bijvoorbeeld aan een Qwen model, uhm, hoewel ze heel slim zijn, willen we eigenlijk vormen naar de schrijfbare kunsten van, van Gemma 4.

63
00:11:05.872 --> 00:11:15.772
Uh, dus we maken een soort van, uhm, nou ja, een hybride tussen de twee modellen. Dus wat nou als ik de intelligentie van Qwen kan nemen en, en de manier van schrijven van Gemma 4. Nou, hoe ziet dat eruit?

64
00:11:15.832 --> 00:11:20.112
Nou, voor ons vooral heel veel reinforcement learning, dus. Ja, want kan je mij, want dit vind ik echt fascinerend.

65
00:11:20.132 --> 00:11:38.232
Kan je mij een beetje meenemen hoe je die elixir ba-[lacht] kookt, maakt, zeg maar, want je bent, eigenlijk zeg je nu: ik ga een soort kinderen maken van of een soort kind creëren van twee modellen waarbij ik zeg: ik wil eigenlijk, ja, een beetje als hoe dat tussen mensen ook gaat, uh, karaktereigenschappen en, uh, biologische eigenschappen van de een mixen met de ander.

66
00:11:38.592 --> 00:11:43.072
Hoe, hoe gaat, zonder al te technisch te gaan, zeg maar, kan je een beetje uitleggen hoe zoiets in zijn werk gaat?

67
00:11:43.552 --> 00:11:54.052
Ja, het is in ieder geval heel veel experimenteren, dus het, het, het, het verbaast mij niet soms dat, uh, we ongeveer 32 experimenten tegelijk draaien, uh, over hoe we dit het beste kunnen doen.

68
00:11:54.352 --> 00:12:05.772
En de strategieën lopen ontzettend uiteen. Uhm, maar een voorbeeld van hoe dit eruit ziet is dat, uh, nou ja, wat nou als we eerst, uhm, een soort van meetbare output kunnen creëren?

69
00:12:05.852 --> 00:12:17.612
Dus bijvoorbeeld: we kunnen een systeem bouwen dat gegeven een output van Qwen kan zeggen: dit is goed of dit is slecht, uhm, kunnen bouwen. Dan zijn we al een heel eind. Soort jury. Ja, een jury inderdaad.

70
00:12:17.752 --> 00:12:30.524
Uh, en dat kan een large language model zijn. Maar dat kan ook, uhEen simpele formule zijn of een simpel simpele check. Uhm en wat we dus doen is. Nou oké, we nemen die die dat Quen grote Quen model.

71
00:12:30.964 --> 00:12:42.604
En daar gaan we dus vervolgens. Ja, we gaan. We maken wat synthetische data met Gamma en dan vervolgens kunnen we dus het Quen model finetunen op de manier hoe Gamma schrijft.

72
00:12:43.004 --> 00:12:56.704
En dan gebruiken we zeg maar die, die score, die jury gebruiken we dus om alle goede Gamma outputs die wel goed geschreven zijn en correct zijn volgens onze jury. Die gebruiken we als ons training data. En ja, dit kan.

73
00:12:56.964 --> 00:13:04.374
Hier gebruikt het woord reinforcement learning voor. En dan vervolgens heb je dus je je Quen basismodel met de schrijfstijl van Gamma voor bepaalde.

74
00:13:04.374 --> 00:13:20.584
En is dit ook hoe de de Chinese labs en de andere labs waarschijnlijk inmiddels ook elkaars modellen, die dus eigenlijk gesloten zijn, wat wat black boxen zijn die je alleen vanaf de buitenkant kan benaderen, ja, daar een soort destillaten van creëren door het gedrag te monitoren van een gesloten model in hun geval.

75
00:13:20.964 --> 00:13:30.024
En vervolgens, ja, toch een beetje dat de inspiratie te halen uit die modellen. En is is dat hetzelfde als wat jullie aan het doen zijn, alleen dan met twee open modellen? Correct? Ja.

76
00:13:30.064 --> 00:13:41.504
Alleen het het verschil is natuurlijk de schaal. Maar ook voor ons moeten we gewoon heel veel data genereren. Dus we gebruiken soms wel tot 64 GPU's 10.00u lang. Om die synthetische om die synthetische data te maken.

77
00:13:41.704 --> 00:13:50.704
Ja, en dan heb je het niet over een paar honderd miljoen tokens, maar miljarden tokens. En daar moet je weer een filter over doen. En ja, die jury moet daar natuurlijk weer een, een mening over hebben.

78
00:13:51.404 --> 00:13:56.164
En als je kijkt wat wat de grotere labs inderdaad doen tenminste. Er wordt veel gedistilleerd inderdaad.

79
00:13:56.224 --> 00:14:04.684
Dus waar we zo'n, zo'n closed source model benaderen met een, een, een output die je interessant vindt en, en daar vervolgens op traint.

80
00:14:04.964 --> 00:14:15.324
Wat je wel merkt is dat alle model providers dit heel graag niet willen, dus dat wordt wel vaak wordt best wel strikt op gemonitord. Ja, dus dat zijn de partijen die de modellen sowieso niet aanbieden.

81
00:14:15.384 --> 00:14:24.444
Openlijk, het zijn hun diamanten die ze in de kluis hebben zitten waar wij van buitenaf voor een x bedrag per token toegang krijgen tot de kluis, maar niet de inhoud, alleen de buitenkant. Correct. Ja.

82
00:14:24.544 --> 00:14:36.004
En eigenlijk vinden ze het helemaal niet prettig als wij enige vorm van magie weten te destilleren vanuit hun kluis. Ja, ja en, en je ziet dat. Wat je natuurlijk ook kan doen.

83
00:14:36.664 --> 00:14:47.624
En je kan dus ook echt je eigen model destillen. Dus op een gegeven moment gegeven die dat, dat Quen plus Gamma model kan ik gebruiken om nog een keer die nieuwe outputs te genereren.

84
00:14:48.244 --> 00:14:56.324
En nu zijn ze ietsjes beter, want ze zijn ietsjes slimmer omdat we Quen als basismodel hebben en Gamma outputs. En dat kan je blijven herhalen. Kan je dan de luisteraar een beetje helpen? Hoe?

85
00:14:56.364 --> 00:15:03.884
Want, en ook mij, want intuïtief denk ik dan je bent toch kopieën van kopieën aan het maken? Dit is een beetje het standaard soort poisoning the well dus van je.

86
00:15:04.264 --> 00:15:12.204
Je bent eigenlijk je eigen output weer aan het opeten en daardoor kan het toch dan. Dan moet je dat kopieer machine effect krijgen van een kopie van een kopie. Maar dat is niet zo.

87
00:15:12.214 --> 00:15:20.704
Ik bedoel empirisch niet waar, want we weten het in de wetenschap en praktisch niet waar, want jij doet het in zekere woorden beter. Kan je ons helpen te begrijpen waarom dat werkt? Ja dus.

88
00:15:22.184 --> 00:15:32.844
Ten eerste ik bedoel de jury is er nog altijd, dus de jury jureert nog steeds. Je kan het zelfs doen dat de jury nog strikter wordt. Dus vanaf nu zijn foutjes die heel fout zijn mogen niet meer meedoen.

89
00:15:33.864 --> 00:15:40.224
Alleen maar foutjes die. Strafpunten. Ja, strafpunten inderdaad. Dus je gaat strikter zijn op op wat de output is van de modellen.

90
00:15:40.344 --> 00:15:52.283
En in praktijk merken we ook gewoon dat als je een model traint op data en dan vervolgens nog een keer dat model gebruikt om die data nog een keer te annoteren, dat je dan toch een beter model krijgt.

91
00:15:52.324 --> 00:16:00.624
Alleen wat daar ontzettend gevaarlijk van is, is dat Whisper v. Whisper is een groot ja, een mooi voorbeeld hiervan. OpenAI Whisper is een spraakherkenning model van Whisper.

92
00:16:00.844 --> 00:16:12.484
Een tijdje geleden uitgebracht en dan heb je dus versie twee en versie drie. En versie twee was een wat meer doortraind model van het originele Whisper Large model. En wat hebben ze nou gedaan voor versie drie?

93
00:16:12.624 --> 00:16:23.964
Ze hebben gewoon enkele miljoenen uren audio van YouTube genomen, nog een keer met Whisper V2 geannoteerd en daar weer door op getraind. Is dit de reden waarom die zo vaak onderaan een transcript zegt?

94
00:16:24.204 --> 00:16:36.104
Pers de bel icon en klik te subscribe. Ja. Want heel vaak hallucineert die YouTube-esk dingen erbij is mij opgevallen. V3. Nou, dus dat is exact het probleem. Whisper V2 deed het ook, maar op mindere mate.

95
00:16:36.144 --> 00:16:50.564
Je zag het minder gebeuren. Maar wat gebeurt er dan bij V3? Juist, dat effect van je hallucinaties worden erger. Maar aan de andere kant is V3 ontzettend goed. Als dit als. Zeg maar als je naar alle benchmarks kijkt,

96
00:16:51.784 --> 00:17:03.044
is Whisper V3 vaak gewoon het beste model. Nog steeds en deels komt het vaak. Vaak valt Whisper V3 wat meer naar beneden in de benchmarks omdat het dus inderdaad.

97
00:17:03.444 --> 00:17:16.584
Klik te subscribe hallucineert op hele moeilijke of stille zeg maar als ik zeg oké en daar stopt de audio en misschien zit er nog wat 5 seconden stilte achter, dan hoor je waarschijnlijk oké, thank you for listening en waarschijnlijk wat vervolgens in de benchmarks.

98
00:17:16.604 --> 00:17:24.624
Wat er dus gebeurt is dat die die foutmarge die explodeert voor dat sample. Maar als je kijkt naar het gemiddelde. Eigenlijk is Whisper V3 nog een ontzettend goed model.

99
00:17:24.764 --> 00:17:35.784
Want voor die hallucinatie zit een door het beetje risico nemen van. Want het is een soort risico wat je neemt. Ja. Als het risico nemen een goede keuze is, heb je enorm een goede match. Ja.

100
00:17:36.024 --> 00:17:45.584
Maar omdat je zo krachtig durft te gokken als het ware, gok je er mogelijk aan het einde op het woord oké, een hele zin bij. Het is een soort ja over enthousiasme van het model zou je bijna kunnen zeggen. Ja.

101
00:17:45.604 --> 00:17:58.264
Dus als je ook ja, voor de ja, de de wat? De nerds onder ons zei je in principe Whisper het model kunnen downloaden en wat je voor de lol kan doen is je haalt de encoder weg en je stopt gewoon niks in het model.

102
00:17:58.584 --> 00:18:08.024
Gewoon helemaal geen audio en je vraagt gewoon een decoder. Voorspel het volgende woord en dan zie je dus heel mooi de, de, de alle tokens die die zouden voorspellen zonder audio.

103
00:18:08.064 --> 00:18:18.464
En dan zie je inderdaad heel veel van TV Gelderland zie je voorbijkomen als je het biased op Nederlands. Als je het biased op Portugees, Spaans, you name it. Elke taal heeft een haar eigen hallucinatie en

104
00:18:19.984 --> 00:18:24.384
je ziet ook dat er heel veel innovatie is van oké, nou wat als je voor het Whisper V3 neemt? En wat nou als je daar

105
00:18:26.124 --> 00:18:32.756
ja.Zelf mee aan de, ja zelf mee aan de slag gaat, ervoor zorgt dat dus die, uh, hallucinaties worden geminimaliseerd.

106
00:18:32.836 --> 00:18:45.275
Ja, je zou bijna kunnen zeggen als je hem dan zonder encoder, dus zonder audiodata laat, uh, genereren, uh, dat je dan wat hij dan genereert gaat gebruiken als antisignaal om, om juist weer op weg te trainen, zeg maar.

107
00:18:45.296 --> 00:18:52.866
Want het eerste wat dan naar voren komt op basis van de minste informatie is hetgene wat het vaakst naar voren komt als hallucinatie. Zeg ik goed dan toch? Ja, nou, dat is, uh.

108
00:18:52.866 --> 00:19:02.716
Ik zou zeggen dat je dat kan gebruiken als antisignaal. Ja, dat is inderdaad, uh, uh, heel, zoals je al zegt, dat is, uh, uh, daar is een paper over gemaakt. Het heet volgens mij Calmer Whisper en daar doen ze exact dit.

109
00:19:03.176 --> 00:19:14.956
En je ziet dus wel dat die hallucinaties aanzienlijk dalen. Je hebt een hele kleine, uh, uh, performance penalty, maar ja, dat contrast, zeg maar, tussen de twee. Uh, je merkt dat dat heel goed werkt inderdaad.

110
00:19:15.076 --> 00:19:18.856
Uh, maar je ziet ook dat er heel veel, uh, te winnen valt als je dat gewoon die stilte weghaalt.

111
00:19:19.216 --> 00:19:26.736
Maar het grappige is natuurlijk wel als je die encoder weghaalt en je hebt alleen die decoder, dan kom je in principe terug bij af. Dan ben je eigenlijk bij een large language model bijna terechtgekomen.

112
00:19:27.316 --> 00:19:35.896
Want wat nou als je, als je de audiocomponent weghaalt en er gewoon al wat tekst instopt van: hallo, ik ben. Een soort primitieve GPT heb je dan eigenlijk te pakken. In principe. Die eigenlijk ook in Whisper zit.

113
00:19:35.916 --> 00:19:45.396
Het is niet voor niets uit OpenAI ontstaan natuurlijk. Nee, exact. En, en dat vind ik heel grappig, uh, dat je dan, zeg maar, toch nog, uh, ja, eigenlijk is het gewoon, uh, het hele sterke van Whisper is geweest.

114
00:19:45.476 --> 00:19:59.435
Wat nou als we, uh, we, we gaan ervan uit dat de audio eigenlijk vaak niet overeenkomt met de tekst, maar dat boeit ons niet, want we hebben zoveel tekst dat we de, de decoder moet zo slim zijn dat hij dat wel zal begrijpen, zeg maar.

115
00:19:59.496 --> 00:20:06.676
Ja, dat hij de gaatjes invult eigenlijk, uh, totdat hij het gaatje aan het einde van de audio invult. En dan gooit hij er nog even een click as a scribe achteraan. Ja, dat is wel heel jammer.

116
00:20:06.716 --> 00:20:11.776
Maar nog even terug naar wat je was aan het vertellen. We doen eigenlijk een, uh, synthese, of in ieder geval een distillation.

117
00:20:11.856 --> 00:20:19.436
We vinden dat Gemma vier goed kan schrijven en we vinden dat Qwen drie zes, uh, eigenlijk heel goed kan nadenken, uh, hoor ik jou zeggen.

118
00:20:19.476 --> 00:20:27.276
En als we die nou eens konden combineren, dan hebben we een soort goed nadenken plus goed schrijven in een nieuw, uh, model. Of in ieder geval een gefinetunede versie van Qwen drie zes, toch?

119
00:20:27.396 --> 00:20:36.556
Ja, met de kanttekening dat dus heel goed is, uh, in de use case voor ons. Uh, want wij gebruiken. Je verliest ook iets als het ware. Je moet betalen met een soort, je bent een soort semi-expert aan het maken.

120
00:20:36.576 --> 00:20:41.035
Expert is misschien het verkeerde woord, maar je bent hem aan het scopen richting een bepaald vakgebied, richting een bepaalde sector.

121
00:20:41.456 --> 00:20:53.616
En daarmee, uh, wordt het model automatisch eigenlijk minder goed in de sectoren erbuiten. Ja, ja. Dus wij gebruiken dat heel veel voor, weet ik veel, uh, ontzettend veel, uh, preprocessing stapjes.

122
00:20:53.836 --> 00:21:07.696
Uhm, we zien gewoon heel veel waarde, uh, in dit soort, ja, alles wat je kan scoren, alles wat je kan meten, alles wat je kan objectificeren is, is heerlijk, want daar kan je reinforcement learning op toepassen.

123
00:21:07.736 --> 00:21:10.296
Het is een beetje tweak, het is een beetje tunen, maar dan heb je gewoon.

124
00:21:10.306 --> 00:21:17.616
Je kan een cirkel creëren en een loop creëren van verifiëren, waardoor je kan gaan heel klein met de, de, ja, je kunt eigenlijk een berg op gaan klimmen en het wordt steeds beter.

125
00:21:17.656 --> 00:21:27.116
En je kunt ook uitleggen dat het beter is in cijfers. Ja. Maar, en, en is het dan zo dat, uh, want dat is misschien nog, uh, voor sommige mensen die het gesprek horen een beetje ingewikkeld.

126
00:21:28.476 --> 00:21:42.576
Komt het dan, komt het er dan op neer dat jullie een finetune van Qwen drie zes hebben, hè, die jullie op allerlei manieren bij mekaar maken en een nieuwe pijplijn maken met stapjes die beter gaat presteren binnen een specifiek domein dan bijvoorbeeld de frontier gesloten modellen van de grote labs?

127
00:21:42.916 --> 00:21:52.166
Absoluut. Ja, dus als je, we benchmarken het ook tegen, uh, uh, voor een paar, uh, samples tegen bijvoorbeeld een OpenAI of een Claude. Uh, en dan merk je dat we het best wel goed doen.

128
00:21:52.626 --> 00:21:58.336
Alleen, uh, ja, wil het niet te veel doen, want dan lijkt het net alsof je distillation aan het doen bent. Uhm, maar.

129
00:21:58.376 --> 00:22:05.076
Nou, jij bedoelt te zeggen, want ik zie ook wel eens op Hugging Face bijvoorbeeld Gemma vier Claude, uh, of Gemma vier, Opus vier punt zeven zie ik dan langskomen.

130
00:22:05.116 --> 00:22:11.836
Dat is ook zo'n soort mix die dan iemand, het kan bluf zijn, hè, maar iemand heeft geprobeerd om een soort distillation te doen op Opus om Gemma vier beter te maken.

131
00:22:12.436 --> 00:22:17.736
Dat is openlijk, want je combineert gewoon een open met een gesloten model in de title van je of de naming van je model.

132
00:22:18.276 --> 00:22:25.236
Maar jij zegt als wij heel goed zouden worden, dan krijg je misschien, ar, komt er misschien wat argwaan rondom onze modellen.

133
00:22:25.276 --> 00:22:35.736
Ja, dus misschien vooropgesteld de modellen die we hiervoor gebruiken zijn allemaal intern, dus we, we, de, de, alles wat we finetunen, uh, gebaseerd op deze modellen is allemaal intern om onze spraakherkenningsmodellen te pretrainen.

134
00:22:36.216 --> 00:22:45.596
Dus, uhm, hoe, ja, hoe we onze modellen trainen, dat, dat is misschien, uh, uh, uh, iets complexer dan alleen dit. Uh, maar

135
00:22:46.736 --> 00:22:59.446
het komt wel heel veel voor dat heel veel stappen die wij nu zien in het trainen van spraakherkenningsmodellen, uhm, complexer worden en ook large language models nodig hebben om betere output te krijgen.

136
00:22:59.496 --> 00:23:13.816
Of betere, uh, ja, overall, uh, data. Uhm, en we zien dat daar nog heel veel te winnen is door zelf purpose built large language models te finetunen alleen voor de, het voorbereiden van je data.

137
00:23:14.716 --> 00:23:19.516
En ik denk dat dat eigenlijk is wa-wat essentieel is om als je gewoon hele goede modellen wil hebben.

138
00:23:20.276 --> 00:23:31.076
Ja, dus je zit toch eigenlijk een stap voor dus, want ik kan me voorstellen ik, ik las bijvoorbeeld dat, uh, Mistral, uh, als product een soort enterprise product finetune models aanbiedt, dus eigenlijk finetunes van hun eigen Mistral modellen.

139
00:23:31.116 --> 00:23:35.536
Dat lijkt een beetje op op wat jij zegt, want zij zien daar markt, uh, en ze zien een gat in de markt ook.

140
00:23:35.576 --> 00:23:43.336
Want ja, de grote frontier labs zijn zo aan het rennen op hun generalized models dat er een enorm gat ontstaat voor hele specifieke, domeinspecifieke modellen.

141
00:23:43.696 --> 00:23:49.636
Ik zeg heel specifiek een domein is nog steeds hartstikke groot, dus het kan nog steeds best wel een, uh, flink, uh, uh, toepasbaar model zijn.

142
00:23:50.636 --> 00:23:57.376
Uhm, is het dan zo dat jij eigenlijk zegt: ja, wat wij doen is onder andere een stap ervoor nog?

143
00:23:57.516 --> 00:24:10.696
Namelijk om een echt een hele bijzondere finetune te hebben, heb je hele goede synthetische data nodig die je alleen maar kan creëren door een eerder gefinetuned model. Ja, precies. Dus wij, wij denken dat,

144
00:24:12.136 --> 00:24:16.776
a-als je daar, en het is maar een klein stapje nog in het hele grote proces. Uh, en,

145
00:24:18.196 --> 00:24:26.056
uh, ja, je kan dus, uh, voorstellen dat het eigenlijk best wel complex wordt, vooral als je richting de 10 miljoen audio-uren gaat, uh, dan is het niet zozeer ook een, een, nou.

146
00:24:26.656 --> 00:24:31.215
Kan je me een use case vertellen dat wat concreter wordt voor ons? Zeg maar, dus, dus waar heb je dan 10 miljoen audio van?

147
00:24:31.256 --> 00:24:42.964
En waar wil je naartoe werken, uh, samen met jullie?Ja dus wat we eigenlijk bij Resonate willen doen is gewoon het allerbeste spraakherkenningsmodel voor Europa dat heel makkelijk is te sturen naar een bepaalde richting.

148
00:24:43.564 --> 00:24:58.824
Dus eigenlijk, uh, wat je maar zou moeten kunnen zeggen: hey Resonate, dit is een gesprek tussen, uh, Thomas en Wietse. Good luck. Niet meer dan dat? Niet meer dan dat. Een podcast over AI niet. Nee. Oké. Nee.

149
00:25:00.104 --> 00:25:08.784
Misschien zou het wel helpen, uh, maar dat is inderdaad waar we naartoe willen gaan. We willen een API aanbieden waar we alle Europese talen ondersteunen.

150
00:25:08.824 --> 00:25:11.414
Waar je inderdaad vraagt: hé, dit is een gesprek tussen deze twee personen.

151
00:25:11.824 --> 00:25:20.204
Maak het beste transcript wat je kan en je kan dat natuurlijk doortrekken naar, dit is een gesprek tussen een fysiotherapeut en een patiënt en dan kan je al zien.

152
00:25:20.214 --> 00:25:26.564
Dat zou helpen als je dat zou toevoegen, omdat jullie daar iets mee doen op de achtergrond. Om het even zo te zeggen. Wij gaan er van alles mee doen. En

153
00:25:28.104 --> 00:25:36.784
om zo'n model te krijgen heb je een behoorlijk complexe, uh, pipeline aan stappen en modellen. Het zijn vaak een ensemble van modellen die samenwerken.

154
00:25:37.564 --> 00:25:47.704
Uhm, en het liefst ook kleine modellen, want spraak is best wel groot. Dus een gesprek van een uur, ja, dat gaat al richting een paar megabyte. Ik bedoel een token, uh, is, is een paar bytes.

155
00:25:47.924 --> 00:25:58.724
En als je dus honderd tokens stuurt, ja, honderden bytes. Audio is veel, veel groter, dus het is ook wat zwaarder om om te voorspellen, uh, over een uur audio dan over tekst.

156
00:25:58.944 --> 00:26:17.644
Ja, en het is natuurlijk als ik dat zo hoor doodzonde op het moment dat je eigenlijk de context ingaat van een, laten we zeggen een patiënt cliënt gesprek bij een huisarts, uh, dat je dan ook nog constant eigenlijk een model hebt die aandacht aan het geven is voor de potentie dat het gesprek ineens wisselt naar een biografie van The Beatles.

157
00:26:18.044 --> 00:26:24.224
Ja. Want dat, want dat stuk luistert dan ook de hele tijd mee, stel ik me dan zo voor. Even, uh, antropomorfiseren van, uh, van het model.

158
00:26:24.704 --> 00:26:31.804
Dat stukje brein luistert ook mee en die zit heel de tijd klaar, mocht het ooit gaan wisselen naar een gesprek over The Beatles. Wat niet gaat gebeuren. Nee.

159
00:26:31.884 --> 00:26:38.064
Als het gebeurt, zou je nog slim ertussen kunnen zeggen: oeh, vlug, gooi er een ander klein model achter die meer weet over muziek en dan gaat hij luisteren.

160
00:26:39.264 --> 00:26:44.204
Ja, dus hoe wij het aanpakken moet natuurlijk wel wat schaalbaarder zijn dan dat, hè. Dus we, we, we moeten wel nadenken.

161
00:26:44.243 --> 00:26:55.004
Oké, nou ja, stel je voor je zou duizend, uh, uh, ja, audiobestanden moeten transcriberen per seconde. Uh, dan, dan gaan dat soort kleinere aanpassingen heel moeilijk worden. Dus

162
00:26:56.444 --> 00:27:04.344
hoe, ja, om bij zo'n model te komen wat dat wel heel goed kan doen vereist dus gewoon dat je ook dat jouw modellen zelf ook gewoon niet zo heel groot zijn.

163
00:27:04.864 --> 00:27:11.184
En hoe kom je nou in een plek waar je modellen niet zo groot zijn, gewoon hele goede data hebben? En hoe kom je aan die hele goede data?

164
00:27:11.304 --> 00:27:20.464
Dus inderdaad, die, die modellen trainen voor betere data, zodat je later weer modellen kan trainen op die hele goede data voor die specifieke use case.

165
00:27:20.784 --> 00:27:30.284
En hebben jullie dan nu als het over use cases is of ik noem steeds sectoren en domeinen. Ik haalde net al de arts en de cliënt of patiënt aan. Dat komt natuurlijk door Juvoli, waar je eerder mee begonnen bent.

166
00:27:30.864 --> 00:27:41.204
Is het, hebben jullie nu even voor mijn idee hoe, om hoeveel sectoren slash domeinen, wat voor woord gebruiken jullie daarvoor, zeg maar, wa-wat zijn nu de bakjes? Een soort experts, mixture of experts achtig?

167
00:27:41.264 --> 00:27:53.024
Niet hetzelfde, maar wat zijn de kleinere modellen die ingeschakeld kunnen worden aan de hand van de context? Ja, ik denk dat we op dit moment, uh, eigenlijk een beetje domein agnostisch zijn.

168
00:27:53.464 --> 00:28:01.124
Kijk, voor, je moet wel in het begin een soort van, uh, domeinen kiezen, uh, om vervolgens ook natuurlijk training data te genereren voor die specifieke domeinen.

169
00:28:01.504 --> 00:28:12.964
En dan hoop je dat het generaliseert naar die andere domeinen. Dus denk bijvoorbeeld aan, nou ja, sowieso gezondheidszorg. Denk aan, uh, finance. Denk aan legal. Denk aan customer support.

170
00:28:13.284 --> 00:28:25.284
En dan heb je eigenlijk al vier hele mooie, ja, verticals, domeinen, uhm, waar we dus per gesprek iets anders kunnen doen. Dus dit is een gesprek, uh, tussen, uh, bedrijf A en bedrijf B.

171
00:28:25.344 --> 00:28:36.144
Of dit is een earnings call van Apple en dan kan je al heel snel zien, nou ja, de kracht van zoiets van oké, als het een earnings call over Apple is, nou, dan weet ik dat dingen zoals Q1, Q2, Q3 belangrijke termen zijn.

172
00:28:36.924 --> 00:28:47.944
EBIDTA, uh, jaartallen, dat worden allemaal belangrijke dingen, dus vervolgens gaan we daar naartoe biasen. We gaan ervoor zorgen dat het model een soort van geprimed wordt voor die specifieke termen.

173
00:28:47.984 --> 00:28:54.784
Nou, die heeft een soort beroepsdeformatie, want die heeft, zeg maar, die hoort in ieder gesprek allemaal finance termen. Maar dat is goed, want dat zijn gesprekken. Ja. Dus dat is oké.

174
00:28:55.063 --> 00:29:03.924
Ja, dus dat is natuurlijk wel de bedoeling. En de kracht is natuurlijk wel om ervoor te zorgen dat niet alles opeens Q1 en Q2 en Q3. Ja, dat is de kunst. Dat is de kunst.

175
00:29:03.944 --> 00:29:09.914
Dat je hem laat soort van overfitten, maar niet, nou, eigenlijk niet, fitten, maar niet overfitten. Ja. Hij moet, hij moet mooi de balans vinden tussen.

176
00:29:09.914 --> 00:29:16.104
Ik zou zeggen dat fitten en niet overfitten vaak, uh, dat, dat proberen we eigenlijk altijd wel te doen. Dat is, dat is de hele kunst sowieso.

177
00:29:16.204 --> 00:29:29.304
En, en, en is het dan zo dat je, uh, even vanuit mij als de ontwikkelaar, zeg maar, zou ik dan eigenlijk bij wijze van spreken als het nog de OpenAI tijd was Whisper V3 Finance aanroepen?

178
00:29:29.824 --> 00:29:32.544
Ik bedoel, eigenlijk wil jij dat ik die keuze niet maak denk ik.

179
00:29:32.624 --> 00:29:49.404
Uh, maar de, er zijn modellen op die verticals, uh, en, en jullie doen ook nog een stuk, in ieder geval nu of in de toekomst, waardoor je zegt: geef ons een tekst prompt context en wij zorgen dat je, dat jij het juiste vertical, uh, getraind model krijgt.

180
00:29:50.104 --> 00:29:55.234
Ja, dus in principe moet dat transparant voor je zijn als gebruiker. Daar, daar is waar je eigenlijk niet over na moet denken. Ja.

181
00:29:55.234 --> 00:30:04.704
Je kan ook zelfs, uh, naar een, een positie gaan waar we zelfs zonder zo'n prompt een inschatting kunnen doen van de prompt. Ja, is een beetje language detection in Whisper, hè, dat ie.

182
00:30:04.964 --> 00:30:13.244
Ja, domain detection zou je het haast kunnen noemen. Ja, domain detection. Uhm, en dat we dan inderdaad tijdens runtime, uh, ervoor zorgen dat we, uh, dat op de juiste manier doen.

183
00:30:13.684 --> 00:30:16.824
En nou ja, hoe het er in werkelijkheid uitziet, ja, dat, dat is iets complexer.

184
00:30:16.924 --> 00:30:26.224
Maar je kan inderdaad wel zeggen dat we dus per domein wel specifieke dingen klaar hebben staan voor, zodat tijdens de transcriptie dat, dat we dan de juiste dingetjes erbij halen.

185
00:30:26.784 --> 00:30:35.764
Een soort van, je kan het zien als een archief, uh, waar we dan af en toe een laatje opendoen van, o, ja, earnings calls. Nou ja, dat is, uh, dan haal ik even deze. Earnings calls detected. Ja. Domain switch engaged.

186
00:30:36.084 --> 00:30:47.364
En is het dan zo dat je, als we het dan verhouden tot Voxtral, eigenlijk wat Mistral recent heeft aangekondigd, die zitten, hè, ik zei al, ze zijn, sowieso bieden ze finetuning aan voor enterprise volgens mij op hun taalmodellen als ik het goed heb.

187
00:30:47.424 --> 00:30:58.351
Ja. En Voxtral is eenDeels open model. Volgens mij draaien ze zelf intern nog een iets gaver Voxtrot die wij niet mogen downloaden. En hoe verhouden jullie je? Waar maken jullie andere keuzes?

188
00:30:58.412 --> 00:31:04.532
Of zeg maar is het, is het prettig dat de markt op die manier ook een beetje gevalideerd wordt door Mistral? Hoe zit je erin?

189
00:31:04.592 --> 00:31:09.912
Ik denk dat het sowieso prettig is dat de markt inderdaad gevalideerd wordt door Mistral, maar ook natuurlijk alle andere aanbieders.

190
00:31:09.952 --> 00:31:19.632
Denk aan ElevenLabs, uh, die natuurlijk wel het meest prominent is, uh, in spraakherkenning. Je hebt ook andere partijen zoals Deepgram en Speechmatics, dus het is fijn dat die validatie er inderdaad is.

191
00:31:20.552 --> 00:31:34.772
Hoe we ons verhouden tot Voxtrot? Ik zou zeggen, uhm, op onze huidige benchmarks, op de huidige modellen, uh, zelfs voor Engels zijn we al een stuk beter. Uhm, Voxtrot is wel een heel ander architectuur.

192
00:31:34.852 --> 00:31:38.452
Het is een best wel groot model. Uh, je hebt ook twee varianten ervan.

193
00:31:38.492 --> 00:31:47.732
Je hebt de streaming variant en de batch variant, dus inderdaad de, de variant waar je gewoon één stuk audio in één keer uploadt en je krijgt transcriptie. Ja, voor 's nachts in de batch. Ja. Huiswerk.

194
00:31:48.032 --> 00:31:55.952
Of, of inderdaad van oké, ik neem iets op en ik wil een transcript over tien, dertig, veertig seconden. Waar wij wel echt voor optimaliseren is snelheid ook.

195
00:31:56.132 --> 00:32:08.071
Dus ik geloof persoonlijk niet zo heel erg in streaming speech-to-text. Als je over nadenkt, ja, waar heb je nou echt streaming speech-to-text nodig? Uhm, kijk, je kan misschien wel leuk live transcriberen.

196
00:32:08.132 --> 00:32:17.072
Ja, een ondertitel die verschijnt tijdens een Zoomcall, ik noem maar even iets. Ja. Ja. Heb je die ondertiteling nu nodig in die Zoomcall? Het kan ook gewoon achteraf zijn. Alleen als user experience is het heel fijn.

197
00:32:17.102 --> 00:32:25.352
Het is een gave demo. Het is een hele gave demo, maar het is ontzettend onhandig voor een spraakherkenningsmodel, want je hebt juist die context in de toekomst nodig.

198
00:32:25.432 --> 00:32:33.032
Je wil juist weten wanneer iemand nou echt klaar is met praten. Je wil juist terug kunnen kijken. Uhm, dus wat we vooral, ja, doen.

199
00:32:33.072 --> 00:32:40.852
Ja, we bieden wel streaming aan, maar ja, als je, als je echt goede kwaliteit wil, dan is het natuurlijk heel fijn als het model de kans krijgt om alles te transcriberen.

200
00:32:40.912 --> 00:32:51.872
Ja, misschien, want ik zie bijvoorbeeld in die Parakeet modellen van NVIDIA zijn die volgens mij, zie ik heel vaak als ik meekijk dat hij aan het transcriberen is, dat hij nog woorden uit de eerste zin aan het aanpassen is terwijl hij aan het luisteren is naar de laatste zin.

201
00:32:52.252 --> 00:32:57.352
Hoe die wel de attention dacht ik aan het einde zijn, maar die is blijkbaar over de hele context. Doen jullie dat ook?

202
00:32:57.392 --> 00:33:04.072
Dat je nog aan het, aan het als een soort kunstenaar om een beeld heen nog tikjes, uh, stenen aan het wegtikken ben op andere plekken de hele tijd?

203
00:33:04.332 --> 00:33:08.472
Ja, absoluut, en ik denk dat daar wel heel veel architectuur verschillen in zijn.

204
00:33:08.732 --> 00:33:22.072
Denk bijvoorbeeld aan als je een, uhm, een uitzending wil live transcriberen voor mensen die, ja, slechthorend zijn of doof, dan, uhm, wil je niet dat dat gebeurt. Super hinderlijk.

205
00:33:22.412 --> 00:33:25.191
Dat de woorden beginnen te schuiven natuurlijk. Dat moet je niet hebben. Dat wil je niet hebben.

206
00:33:25.972 --> 00:33:36.802
En dan moet je dus overgaan op een architectuur die is, die dat gewoon gelijk goed heeft en misschien tegen een bepaalde delay, hè, dus misschien twee tot vier seconden, maar dan, ja, is dat, is dat snel genoeg voor de gebruiker?

207
00:33:37.412 --> 00:33:44.312
Dus, dus daar zit al gelijk architectuur verschil in. Dus inderdaad, wat Parakeet streaming doet, dat heeft vaak een beetje te maken met beam search misschien.

208
00:33:44.352 --> 00:33:56.912
Dus wanneer je, uhm, eigenlijk toont die continu wat het model denkt dat het meest logische is. Maar stiekem heb je nog vier achter de hand en die langzame hand wordt steeds logischer welke variant het nou eigenlijk was.

209
00:33:57.312 --> 00:33:59.932
En dat kan verschillen. En dan wint een andere als het ware. Ja.

210
00:34:00.132 --> 00:34:07.752
Die staan er vier klaar met een x percentage probability en op een gegeven moment gaan die probabilities, kunnen nog de hele tijd tot het einde van de opname, zeg maar, kunnen nog wisselen.

211
00:34:07.812 --> 00:34:18.291
Ja, dus en dat zie je vooral gebeuren bij, uh, ja, Parakeet is dan in dit geval een transducer. Uh, dat betekent dat hij wel een bepaalde, uh, uh, ja, confidence heeft over een zin.

212
00:34:18.782 --> 00:34:23.992
Dat kijkt niet ontzettend ver terug, zoals we dat kennen van attention, waar dat nog eenmaal terugkijkt naar het verleden.

213
00:34:24.712 --> 00:34:42.012
Uh, transducers, die zijn wat, uh, ja, sneller, want die hoeven dat allemaal niet te doen, maar die kunnen nog wel op het moment dat er een woord toch nog even verandert, uh, vooral gebaseerd met een wat licht, ja, lichter language model noemen we dat dan, een Ngram language model, kan die bias opeens omhoog schieten als een, bijvoorbeeld een woord wordt herhaald.

214
00:34:42.172 --> 00:34:53.102
Of, uhm, ja, ik toch, uh, het had over een, een, een dierentuin in plaats van een speeltuin omdat ik opeens olifant zegt. Dat is natuurlijk wel wat meer wat we zien in, ja, decoders als transformers.

215
00:34:53.152 --> 00:35:02.432
Die zijn daar heel goed in. Die kunnen heel makkelijk, uh, die, die, die context maken. En, en Parakeet, de, the transducer die daarin zit niet zo heel goed. Uhm, maar dit is exact wat er gebeurt.

216
00:35:02.892 --> 00:35:07.092
En het is dan nu, want ik, ik weet, uhm, Juvoli, uh, even een stapje terug.

217
00:35:07.132 --> 00:35:17.632
Dat was eigenlijk, jij hebt de Whisper paper gelezen, uh, en, uh, bent daardoor geïnspireerd geraakt en hebt daardoor, je bent, dat is al lang, was al lang geen finetune meer uiteindelijk toch?

218
00:35:17.852 --> 00:35:30.612
Hè, je bent eigenlijk opnieuw, uh, begonnen. Is het hier ook zo? Want je had het net over Qwen 3.6 en Gemma 4, maar dat is eigenlijk een, en daar komt dan een kindje uit, zeg maar, een, een nieuw model, een soort hybrid.

219
00:35:31.232 --> 00:35:43.632
Maar die hybrid is onderdeel van een pipeline, want daarvoor zit het, ik, waar moet het, waar moeten die twee language models eigenlijk over denken? Wat is hun input? En die komt uit een, uh, speech-to-text model, toch?

220
00:35:43.692 --> 00:35:48.472
Ja, dus je hebt er meer- Je hebt een blokje beschreven van je. Ja, het is een heel klein blokje. Ja.

221
00:35:48.512 --> 00:35:58.382
En dit specifieke blokje, dat, dat is dan weer specifiek voor, nou ja, hoe, hoe kan je nou eigenlijk van een prompt gaan naar, uh, een domein? Uh, hoe kan je nou goed classificeren?

222
00:35:58.452 --> 00:36:13.292
Wat, wat betekent het nou echt als iemand zegt: dit is een gesprek over een patiënt en een, uh, fysiotherapist, wa-wa-therapeut? Wat is nou echt het, uhm, ja, wa-waar moet het over gaan? Waar gaan we het nu over hebben?

223
00:36:13.352 --> 00:36:23.692
Is het juist, uh, oh, dan gaan we heel veel praten over ziekenhuizen. Nee, dan gaan we praten over, uh, mijn, mijn, mijn lichaam, uh, mijn, mijn been, mijn hand, et cetera.

224
00:36:23.772 --> 00:36:35.752
En die link leggen is eigenlijk ontzettend moeilijk, want je, je moet natuurlijk nadenken van oké, wa-waar gaat dat domein heen? En hoe kunnen we op een manier die data genereren zodat, uhm, we dat altijd goed krijgen?

225
00:36:36.692 --> 00:36:41.162
Dus dat is een heel klein blokje. En als je kijkt naar de audiokant, dan doen we ook soortgelijke dingen.

226
00:36:41.572 --> 00:36:48.352
Dus hoe kan je nou zo goed mogelijk van audio naar, ja, toch een annotatie gaan zonder dat je eigenlijk weet wat er is gezegd?

227
00:36:48.912 --> 00:37:01.032
Dus waar, waar Whisper heel erg veel, uhm-Uh, uh, gebruik maakte van de ondertiteling die de gebruikers hadden gegeven, uh, op YouTube, moeten wij het met wat minder doen.

228
00:37:01.412 --> 00:37:05.332
Uh, maar de data die we hebben, daar moeten we heel, heel goed mee omgaan.

229
00:37:05.372 --> 00:37:16.832
Dus we moeten best wel complexe pipelines hebben om ervoor te zorgen, dus dat we zo nauwkeurig mogelijk, gegeven alle tijd, dus gegeven alle compute die we hebben, hoe kunnen we nou bijvoorbeeld voor deze podcast de perfecte transcriptie maken?

230
00:37:17.532 --> 00:37:24.232
En dan krijg je dus een best wel uitgebreide pipeline van heel veel stapjes, uh, die waar, waaruit, ja, dat duurt misschien lang.

231
00:37:24.692 --> 00:37:31.952
Misschien duurt het een uur om voor een uur audio het perfecte transcript te vinden, maar het is wel hele goede training data.

232
00:37:31.992 --> 00:37:40.372
Want hoe, ik wil juist voorkomen dat wij ook tv-relland gaan zeggen, uh, in onze ondertiteling of thank you for subscribing. En hoe, ja, hoe kom je daar nou?

233
00:37:40.452 --> 00:37:50.652
Dat is een beetje de magie van, uh, waarvan ik nu heel erg geloof dat, dat datakwaliteit eigenlijk de koning is in, in alle spraak als je kijkt naar de meeste modellen.

234
00:37:50.972 --> 00:37:57.612
En de, uhm, er zullen nu luisteraars zijn die, uh, niet met de handen op het stuur zitten, dus dit moet je alleen maar volgen als je op een veilige plek bent.

235
00:37:58.212 --> 00:38:09.072
Ga even als je in Spotify luistert naar de modus toe waarin je mee kan lezen met dit gesprek. Dan ga je nu namelijk zien, en dat heb je misschien eerder al gezien, die is niet zo best.

236
00:38:09.612 --> 00:38:15.132
Sterker nog, mijn naam weet ie vaak niet. Het woord AI gaat zelfs mis, terwijl dat staat in de titel van de podcast.

237
00:38:15.672 --> 00:38:27.292
Waarom gaat het-- ik krijg ook best wel vaak de opmerking namelijk van mensen: hoe bizar is het dat jullie een podcast maken over AI waarin je constant praat over best wel hoge intelligentie en indrukwekkende dingen tot aan zelfrijdende auto's.

238
00:38:27.712 --> 00:38:38.092
En dan zie ik Spotify daar proberen een transcript van te bakken achteraf. Het is niet eens live, zeg maar. En het is gewoon heel erg matig. Kan je een beetje inschatten waarom dat niet goed gaat daar?

239
00:38:38.832 --> 00:38:51.852
Ik denk dat het deels komt omdat we eigenlijk stiekem ook niet zo heel goed zijn in transcriberen. Uhm, soms, wij zien heel snel als we naar tekst kijken of iets een transcriptiefout is of niet.

240
00:38:52.432 --> 00:38:54.712
Dat, dat kunnen wij als mensen er heel makkelijk uitpikken.

241
00:38:55.572 --> 00:39:03.571
Maar probeer maar eens een keertje een willekeurig gesprek te luisteren en te transcriberen en je zal zien dat je heel vaak denkt van: nou, wat werd er nou eigenlijk gezegd?

242
00:39:03.852 --> 00:39:18.062
Het moet of 't moet en, of is de het niet eens gezegd? Verzin ik dat? En, en zo kom je eigenlijk ontzettend veel, vaak tegen dat wij als mensen stiekem ook niet zo heel erg goed zijn in transcriptie. Specifieke termen,

243
00:39:19.052 --> 00:39:25.852
dat is natuurlijk de achilleshiel van alle spraakherkenningsmodellen en dat komt ook deels vanwege de ambiguïteit van spraak.

244
00:39:26.552 --> 00:39:38.832
Dus daarom, bij Resonate geloven we heel erg in elk gesprek is specifiek voor de context die we hebben en we hopen zo goed mogelijk die context te begrijpen en in die context het perfecte transcript te maken.

245
00:39:40.752 --> 00:39:47.772
Deels komt het ook omdat spraakherkenning alsnog gewoon een best wel dure operatie, zeg maar, het is een best wel duur iets om te doen qua compute.

246
00:39:48.612 --> 00:39:54.912
Uh, het is niet zo duur als text to speech, dat is ontzettend duur, maar het is zeker duurder dan een large language model.

247
00:39:55.012 --> 00:40:09.132
Jij bedoelt ook te zeggen: ook al heeft Spotify toegang waarschijnlijk tot veel zwaardere, uh, intelligentere of in ieder geval beter in transcriberen modellen, we zitten te kijken naar iets wat met light of flash gedaan is en niet met het, uh, met het, met het zwaarste gewicht.

248
00:40:09.292 --> 00:40:18.752
Dat is gewoon te duur. Ja, dus, ja, als je kijkt naar bijvoorbeeld, uh, uh, Gemini volgens mij, ja, moet ik me eigenlijk niet op quoten. Ik denk €0,18 per uur nu misschien om te transcriberen.

249
00:40:18.852 --> 00:40:29.052
Misschien iets minder, €0,08. Uhm, ja, dat, dat voegt wel toe, denk ik. Ik bedoel, het is nog best wel prijzig als je het op schaal zou doen, denk ik, voor, als een gratis feature. Uhm,

250
00:40:29.972 --> 00:40:41.132
dus het, het is ook niet zozeer de goedkoopste mode, modality, uh, die er is. Uhm, dus dat voegt ook toe dat we vaak neigen naar wat lichtere gewichtige modellen. Kijk bijvoorbeeld naar Parakeet.

251
00:40:41.532 --> 00:40:46.412
Parakeet is een, is een heel klein model, 600 miljoen parameters. Een transducer decoder.

252
00:40:46.452 --> 00:40:59.232
Dus dat betekent dat het niet het meest intelligente is, maar wel heel erg, uh, ja, z'n best zal doen om, uh, akoestiek goed te vangen. Uhm, en, en dat is toch een beetje de balans van oké, wat wil ik?

253
00:40:59.252 --> 00:41:08.192
Wil ik iets wat superintelligent is en wat je net als Whisper, uh, kan invullen wat er mogelijk is gezegd? Of Parakeet, die wat meer letterlijk zal proberen te transcriberen wat er is.

254
00:41:08.232 --> 00:41:20.332
En dan zie je een groot verschil tussen de throughput. Dus een Parakeet kan voor 4.000 uur audio, of sorry, ja, 4.000 uur audio per uur transcriberen. En ja, een, een Whisper, dat gaat al snel richting de 40, 80, 800.

255
00:41:20.532 --> 00:41:31.012
Nou ja, dat, dat op, op dan de, de Blackwell B200. Maar ja, niet iedereen heeft die natuurlijk liggen. Uhm, dus ik denk dat dat voor de factoren zijn. Maar het komt wel heel vaak neer op die ambiguïteit van spraak.

256
00:41:31.732 --> 00:41:42.552
En heb je nu, als je dan kijkt naar, uh, we hebben het veel over Whisper gehad al. Er is nooit meer een Whisper V4 uitgebracht voor zover ik weet. Die is er niet, toch? Volgens mij zijn ze er wel mee bezig.

257
00:41:42.652 --> 00:41:53.271
Oh, jij verwacht misschien nog wel een open model van, uh, OpenAI. Ik, ik verwacht het, ja, misschien. Ik, ik zou het niet zozeer weten. Mij is wel eens verteld dat ze ermee bezig zijn of dat het zit aan te komen.

258
00:41:53.912 --> 00:42:04.912
Uh, je merkt sowieso dat in spraakherkenning er heel veel modellen worden geproduceerd. Alleen waar het, het, het vervelende van spraak is vaak dat, nou, taligheid is natuurlijk een best wel groot probleem.

259
00:42:04.952 --> 00:42:11.612
Dus welke talen worden ondersteund? Bij een LLM gaan we er gewoon van uit dat alles erin zit. Bij spraakherkenning is het nog best wel ingewikkeld.

260
00:42:12.292 --> 00:42:19.592
Uh, je ziet bijvoorbeeld heel vaak dat Zweeds wel wordt ondersteund, maar Noors niet. En dat is natuurlijk wel een grappig, uh, probleem.

261
00:42:20.052 --> 00:42:27.132
Uh, want ja, uh, nu heb je opeens, stel je voor, ik, ik wil in Scandinavië actief zijn, dan moet ik toch opeens twee modellen hebben tegelijk.

262
00:42:27.832 --> 00:42:36.572
Uhm, en natuurlijk Whisper doet 101 talen, maar het Noors van Whisper is heel slecht. Maar het Zweeds is weer heel goed, dus zit je gelijk weer in een soort van rare situatie.

263
00:42:37.312 --> 00:42:47.932
Uhm, en ik denk dat bij spraakherkenning het niet zozeer altijd gaat om het model. Het gaat ook veel meer om wat het model goed kan. Dus hoe robuust is het model? Dus in benchmarks is alles makkelijk.

264
00:42:48.232 --> 00:43:00.884
In benchmarks vaak is- Waarom zeg je dat zo? In benchmarks is alles makkelijk. Nou ja, in benchmarks vaak is het gewoon goed gearticuleerd. UhmDe, de diversiteit is, is, is best wel oké, goed te doen.

265
00:43:00.944 --> 00:43:08.184
Niet veel verschillende sprekers. Als je kijkt naar de benchmarks die nu heel populair zijn, dan moeten we vooral denken aan Google Fleurs. Denken we aan Common Voice.

266
00:43:08.944 --> 00:43:18.964
En, uhm, ja, dan heb je nog op Hugging Face een hele mooie benchmark. Die heet, uh, de Open ESR Leaderboard en dat is een mooie mix van, van benchmarks, maar vaak is het gewoon clean speech.

267
00:43:19.404 --> 00:43:33.404
Uhm, en het grappige is ook dat vaak de woord-- de, de foutmarges op die benchmarks niet zoveel te maken hebben met het model, maar eerder met het feit dat de mensen die hebben meegedaan aan een experiment gewoon veel beter kunnen articuleren wat er wordt gezegd.

268
00:43:33.584 --> 00:43:42.644
Uhm, dat, dat merkten wij heel erg van oké, nou ja, ik kan het wel benchmarken op deze benchmark, maar het is een best wel makkelijke benchmark. En de fouten die we maken, dat is eerder in, in getallen.

269
00:43:42.704 --> 00:43:53.144
Dus schrijf je vijftien uit als vijftien of één vijf. En ja, dat is al een fout. Uh, ja, oei, uh, is mijn model dan slecht? Of is dat eerder een voorkeur van de downstream consumer?

270
00:43:53.224 --> 00:44:01.984
En dan zit je weer, dan ga je weer terug van oké, een model kan wel heel goed zijn, maar wat nou als ik ervan uitga dat getallen altijd als één en vijf worden uitgeschreven?

271
00:44:02.744 --> 00:44:09.824
Uhm, en dan hebben we het nog over performance. Dus wat voor type model is het? Is het een transducer zoals Para-- ik bedoel conform een transducer zoals Parakeet?

272
00:44:10.284 --> 00:44:20.184
Ja, ontzettend snel, heel goed akoestisch, maar vaak niet heel robuust, uh, in de praktijk en ook niet heel erg stuurbaar, want ik, ik heb geen stuurbaarheid. Ik heb geen, uhm,

273
00:44:21.164 --> 00:44:30.054
transformer zoals ik die bij Whisper wel heb. Waar ik in Whisper kan ik een soort van prompt meegeven ook. Uhm, niet een beetje hetzelfde wat wij doen, maar het is wel een type van, van stuurbaarheid.

274
00:44:30.064 --> 00:44:36.904
Om een beetje te helpen. Ja, dus je, je zou misschien toch zeggen dit is gesprek tussen Wietse en Thomas en vervolgens, uh, gaat het wel goed.

275
00:44:37.604 --> 00:44:48.144
Uhm, maar ja, het is weer een heel traag model en, en, en zo heb je zoveel dimensies in een spraak en denk ook word on latency, dus is het streaming? Heeft het goed support voor stiltes?

276
00:44:48.624 --> 00:44:57.564
Kan het events zoals dat ik misschien, ja, een telefoon op rinkelt of, of een piep hoor. Al dat soort dingen worden allemaal niet meegenomen in benchmarks.

277
00:44:57.824 --> 00:45:07.743
En zou het dan niet interessant zijn om, want jullie hebben best wel wat data inmiddels, uh, en jullie weten wat er in de realiteit speelt versus wat er in een soort benchmarkdroom [lacht]

278
00:45:07.824 --> 00:45:15.084
simulacrum gebeurt waarin iedereen blijkbaar goed articuleert, terwijl in de echte wereld is, zijn er gewoon binnen Nederland al allerlei verschillende manieren van spreken.

279
00:45:15.684 --> 00:45:21.804
Uhm, is heeft het geen zin om een vierde benchmark toe te voegen? Ja, er is het laatst volgens mij wel een mooie benchmark uitgekomen.

280
00:45:22.364 --> 00:45:27.563
Ik denk dat, ja, als je zelf een benchmark uitbrengt, ja bewijs maar dat jij niet- Bij van WC-eend. Ja.

281
00:45:28.104 --> 00:45:34.784
Dus ik denk dat voor ons, ja, we hebben gewoon interne benchmarks en daar ben ik altijd heel blij mee als we het daar goed op doen. Uhm,

282
00:45:35.964 --> 00:45:44.604
maar de allermooiste benchmark is gewoon gebruikers die het blijven gebruiken en ik denk dat dat, uh, heel belangrijk is. En heb jij, uh, want als je dan kijkt,

283
00:45:45.664 --> 00:45:50.524
als we nu kijken naar Mistral, ik had het er al even over, want ze hebben Voxtral en ze doen finetunes voor Enterprise.

284
00:45:50.884 --> 00:46:05.984
Ze lijken de, de strijd rondom een grote multimodel frontier, uh, model, uh, hoe die dan ook gecombineerd is qua technologie een beetje op te hebben gegeven voor nu in ieder geval dat, dat idee heb ik dan. Is het, uh, is

285
00:46:07.064 --> 00:46:18.044
speech-to-text, uh, belangrijk genoeg en interessant genoeg om echt een, een, een deuk in een pakje boter te slaan, zeg maar in de markt, in, in de wereld? Uh, waarom focus jij je daarop?

286
00:46:19.144 --> 00:46:32.384
Ik denk dat voorlopig speech-to-text iets is, uh, wat, ja, kleinere AI-bedrijven zoals wij, uh, echt in kunnen concurreren. Dus natuurlijk de large language models, dat is gewoon ontzettend moeilijk om in te concurreren.

287
00:46:32.424 --> 00:46:39.964
Ook als je kijkt naar de compute die daarvoor nodig is, is gigantisch. Spraakgestuurde modellen zijn altijd maar rond die een miljard, drie miljard parameters.

288
00:46:40.764 --> 00:46:49.024
Uhm, en dat is superfijn, want dat betekent dat als jouw model twintig keer kleiner is, heb je vaak ook twintig keer minder compute nodig.

289
00:46:49.084 --> 00:47:01.804
Ja, want voor, voor, voor mijn idee, hoeveel kleiner zijn jullie modellen dan bijvoorbeeld een Opus? Als ik wist hoe groot Opus was dan, uh. Dat weten we niet, hè. Ja. GPT-120, uh, O, OSS.

290
00:47:02.304 --> 00:47:12.424
Ja, dus onze modellen zitten, ja, kom je toch zestig keer kleiner. En het mooie is ook dat heel veel dingen schalen ook een beetje, uh, steeds agressiever naarmate een model groter wordt.

291
00:47:12.464 --> 00:47:23.124
Dus als een model nog, uh, in zijn eentje op, op de GPU past, dan is het heel fijn. Maar het moment dat je, zeg maar, daar, daar buiten gaat is het ontzettend niet fijn.

292
00:47:23.284 --> 00:47:31.124
Want ja, dan moet je dus je model sharden en dan krijg je opeens twee GPU's die hetzelfde model in stukjes hebben. En ja, dat, dat heeft een bepaalde performance.

293
00:47:31.244 --> 00:47:48.804
Ja, ik begrijp dat Gemma 4130B bedacht is op een beetje de, ja, wat past op een betaalbaar, doe ik even met air quotes, uh, GPU, uh, waar je dan 48 gig VRAM hebt en daar past dan zo'n, plus context, een 31 B-model van, uh, van Google in.

294
00:47:48.844 --> 00:47:56.284
Ja. Dus je gaat een beetje modellen maken aan de hand van hardware. Klopt. Ja en ja, bij trainen is het natuurlijk wel het vervelender, want dan heb je veel meer dan alleen een model.

295
00:47:56.464 --> 00:48:08.204
Dus dan heb je bijvoorbeeld de, de, de, de states van de parameters. Je hebt je optimizer. Uh, dat zorgt er vaak voor dat je twee keer zoveel memory nodig hebt, ongeveer, uh, dan bij inferencing.

296
00:48:08.704 --> 00:48:17.104
Dus je gaat- Ja, dus het bakken van het brood, uh, is twee keer zo zwaar als het opeten, even. Ja, ja, ja. Dus het bakproces is best wel intens. Ja, vaak wel.

297
00:48:17.364 --> 00:48:25.684
En, en ja, bij spraak is natuurlijk een beetje het omgekeerde probleem. Dus je, je parameter sizes zijn zestig keer kleiner, maar je datagrootte is zestig keer groter.

298
00:48:26.164 --> 00:48:34.404
Dus het aantal datapunten, uhm, als je denkt aan prompt, uh, in, in large language models zijn misschien honderden miljoenen in, in een trainingsset.

299
00:48:35.084 --> 00:48:46.924
Uhm, voor ons is een trainingssample, uhm, een audiobestand en een transcript. En zo'n audiobestand is vaak best wel groot, dus we gaan al richting een beetje een halve petabyte aan data.

300
00:48:47.684 --> 00:49:00.474
En om daar makkelijk, uh, op te experimenteren en zo, dat brengt nog al wel eens, uhm, ja, wel, wel wat complexiteit met zich mee. Dus hoe, hoe kan je nou snel een halve petabyte aan data, uh, verwerken?

301
00:49:01.104 --> 00:49:08.594
Uh, en dan is het allemaal audio en dan, ja, dan moet je meerdere nodes en meerdere GPU's over meerdere nodes. Nou ja.Het, het is niet altijd even simpel.

302
00:49:08.734 --> 00:49:16.074
Ja, want jij zei net voordat we begonnen vroeg ik aan je: hoeveel tijd heb je? Zij nou, over ongeveer drie uur loopt er een training run af, dus dan wil ik, uh, gaan kijken hoe die gegaan is.

303
00:49:16.194 --> 00:49:19.254
Dan komt er weer een, een, uh, brood uit de oven. Ja. Even kijken wat er gebeurd is.

304
00:49:19.634 --> 00:49:30.114
Kan je me, kan je ons een beetje meenemen in, uh, want alle labs op hun eigen manier zijn constant broden aan het bakken, experimenten aan het doen, met deeg aan het wisselen. Ik blijf even binnen de metafoor.

305
00:49:30.314 --> 00:49:38.054
Neem ons een beetje mee. Hoe ziet dat er dan uit voor jullie, zeg maar? Hoe vaak zijn training runs afgelopen? Is het ook wel 's nachts? Moet je er dan uit? Uh, ja.

306
00:49:38.114 --> 00:49:52.214
Ja, ik word ontzettend onrustig als onze, ja, we hebben nu, uh, tachtig GPU's, als ze allemaal niks doen of als er eentje maar niets doet, dan word ik gewoon heel onrustig. Er moet altijd minimaal

307
00:49:53.114 --> 00:50:03.474
iets draaien op een GPU. Ja, en dat is misschien dan wel goed om te weten is dat je, veel andere bedrijven die huren GPU's per seconde, uh, bij een grote hyperscaler, hè. Dus zolang je niet gebruikt betaal je ook niet.

308
00:50:03.594 --> 00:50:13.534
Of je moet hebben afgesproken dat je ze hebt gereserveerd. Maar goed, laten we niet te ingewikkeld maken. Jullie hebben GPU's. Ja. Dus ja, iedere seconde dat die niet draaien is gewoon zonde. Ontzettend zonde.

309
00:50:14.014 --> 00:50:21.414
Uhm, maar het is wel hele mooie, nou ja, gigantische stok achter de deur voor mij om, uh, ervoor te zorgen dat we ook gewoon altijd bezig zijn.

310
00:50:21.914 --> 00:50:32.393
En het vervelende soms is dat een experiment misschien maar één GPU nodig heeft. Uhm, dus soms wil je gewoon spelen met ideeën en het is gewoon heel veel, uhm, nieuwe ideeën proberen.

311
00:50:33.154 --> 00:50:44.554
Uhm, een van de dingen waar ik nu op dit moment mee bezig ben is reinforcement learning voor spraakherkenning. Uhm, en dan merk je dat, ja, het werkt ontzettend goed. Uh, maar ja, dan generaliseert het weer slechter.

312
00:50:44.614 --> 00:50:58.094
En dat, dat, de balans vinden, dat vereist soms gewoon honderden experimenten. Uh, is het met data? Moet ik gewoon, nou ja, toch die halve petabyte opnieuw annoteren? Oh god, uhm, of moet ik nou toch weer, uh, ja,

313
00:50:59.274 --> 00:51:08.454
misschien de papers induiken en, en dat, dat is heel, dat varieert heel erg, maar ja, in parallel heb je ook gewoon weer je andere blokjes in je pipeline die ook moeten verbeteren.

314
00:51:09.194 --> 00:51:18.814
En het stomme is nu dat dankzij Claude, Claude Code heb ik het dan over, uhm, dit eigenlijk oneindig paralleliseerbaar is. Dus. Waarom? Nou ja,

315
00:51:20.034 --> 00:51:25.554
ik heb op dit moment meer dan acht sessies open, uhm, en elke sessie doet weer iets anders.

316
00:51:25.574 --> 00:51:33.174
En het mooie is natuurlijk als je nu met Claude Code kan zeggen: ha, ik, ik ben toch benieuwd wat er gebeurt als ik deze losfunctie gebeurt in plaats van deze.

317
00:51:33.794 --> 00:51:39.974
En is het een beetje ook het recursieve wat we nu zien, hè, want, hè, het gaat vaak over, uh, het is het, uh, uh, self optimizing AI.

318
00:51:40.074 --> 00:51:49.714
Maar eigenlijk hoor ik hier al dat Claude Code in de vorm van Claude in de vorm van het harnas code, die werkt al bij jullie. Even, even zo gezegd. Ja. Die doet mee. Die doet ontzettend mee.

319
00:51:49.834 --> 00:51:52.894
Ja, en die, die, die boost als het ware de, de snelheid van ontwikkeling.

320
00:51:53.234 --> 00:52:05.654
Ja, dus wat gewoon voorheen ontzettend vervelend was in experimenteren met, uh, uh, het trainen van modellen was gewoon: oké, ik heb een experiment, ik moet me los goed definiëren.

321
00:52:05.674 --> 00:52:11.414
Oké, denk, denk ik dat dit, voor, voor reinforcement learning had ik daar vooral heel veel last van. Oké, wat zijn nou allemaal hyperparameters?

322
00:52:11.454 --> 00:52:20.854
En als je kijkt naar voor GRPO, nou ja, heb je de KL, dan heb je, uhm, dus de divergence. En, en dan misschien, en dat is dan eigenlijk, ik probeer me even voor te stellen.

323
00:52:21.254 --> 00:52:26.774
Ik heb een goede vriend van mij, die houdt van hele goede koffie en die heeft dan een heel schema gemaakt van alle parameters die horen bij koffie.

324
00:52:26.794 --> 00:52:33.514
Dat is dus gewoon de hardheid van het water, hoe je boilertje opwarmt, waar zijn koffiezetapparaat staat, wat de luchtvochtigheid is. Je voelt hem aankomen.

325
00:52:33.554 --> 00:52:42.494
Hij heeft het, hij heeft volgens mij 28 parameters of zo en die probeert hij dan allemaal te managen. En iedere keer als hij natuurlijk ergens aan zit, moet hij iedere keer één ding aanpassen en één keer testen.

326
00:52:42.534 --> 00:52:52.434
Want ja, het één heeft weer een effect op een ander. Ja. Zo heb jij ook allemaal knoppen, volumeknoppen en schuivers waar je aan kan komen in je totaalplaatje. Jammer genoeg wel ja.

327
00:52:52.454 --> 00:52:57.254
Die allemaal ook nog eens invloed op elkaar hebben, potentieel. Waarschijnlijk wel. Ja. Ja. Leuke puzzel.

328
00:52:57.594 --> 00:53:09.454
Nou ja, dus, het is ook een hele leuke puzzel, omdat het natuurlijk superleuk is als de modellen die je dan traint, als de, de, toch, dat, dat zuurdesem brood dat je bakt, uh, er perfect uitkomt.

329
00:53:10.054 --> 00:53:21.194
Uh, en dat, ja, d-dan denk je van: oké, we gaan de goede kant op. Nou kan het ook superfrustrerend zijn dat je gewoon een week lang lukt het gewoon niet om de baseline te verslaan.

330
00:53:21.294 --> 00:53:31.534
Uhm, maar ik voel me wel zo best wel krachtig met zo'n leger van, zeg maar, experimenten van oké, j-j-je bent zelf een soort van aan het meta trainen. Je doet ook gradient descent.

331
00:53:31.594 --> 00:53:38.494
Je, je probeert zelf je optimale, uh, uh, ja, pipeline te vinden en dat heeft ook vaak heel veel fouten.

332
00:53:38.694 --> 00:53:56.014
Ja, je bedoelt binnen de machine zijn bepaalde methodieken die gebeuren als jij er niet bij bent, maar die eigenlijk, nou ja, door middel van, uh, uh, uh, ja, alle methodieken die je hebt om te reinforcen, uh, zo'n, zo'n, uhm, berg opklimt richting een betere score dan de baseline op je eigen benchmarks, als ik je zo hoor.

333
00:53:56.664 --> 00:54:00.294
Maar jij zegt: eigenlijk ben ik dat samen met Claude ook aan het doen. Ja.

334
00:54:00.394 --> 00:54:09.814
Hè, want dat is een beetje dat, dat, dat gekke nu binnen die AI labs, dat je samen met AI een proces aan het doen ben om het creëren van modellen ook te verbeteren.

335
00:54:10.354 --> 00:54:21.174
Niet, dus niet alleen maar, uh, wat je bakt, maar hoe je bakt. En beide zijn onderhevig aan soortgelijke dynamieken. Ja, en, het, ik denk als je dat niet doet, dat je ontzettend achterligt.

336
00:54:21.474 --> 00:54:31.974
Uhm, maar, het, wat ik wel vaak merk is dat Claude ook wel ook heel goed is in dingen niet goed doen. Dus het is vaak heel veel voorkauwen. Dus het is nog wel altijd

337
00:54:33.114 --> 00:54:43.334
executeren, dus uitvoerend, maar het is niet zelf, ja, het, het komt zelf niet met goede ideeën. Dus het komt zelf met hele goede slechte ideeën. En, en dat is natuurlijk heel vervelend.

338
00:54:43.394 --> 00:54:49.294
Want ja, of juist heel goed, want ja, anders, uh, uh, is het misschien niet zo moeilijk allemaal, zo'n, zo'n spraakherkeningsmodel trainen.

339
00:54:49.534 --> 00:54:57.754
Maar ik kan me voorstellen dat het voor jou ook zo is dat je heel vaak even als een soort laborant proefjes hebt die gewoon gedaan moeten worden, die jij hebt ontworpen als het ware.

340
00:54:57.814 --> 00:55:04.534
Want je denkt: ja, ik hoef daar niet de hele tijd bij te zijn. Nee. Ik laat jullie lekker je proefjes doen en ik hoor wel wat het resultaat is en dan ga ik in de tussentijd weer verder.

341
00:55:04.854 --> 00:55:13.014
Dus jouw rol is dan veel meer een soort van head of research binnen zo'n soort lab, letterlijk, uh, versus dat je nog zelf proefjes aan het doen bent.

342
00:55:13.034 --> 00:55:18.234
Ja, ik denk dat dat precies is wat het is enEhm, het is ook ontzettend leuk.

343
00:55:18.674 --> 00:55:28.594
Uh, het is een beetje verslavend ook, want, uhm, opeens door heel weinig, uh, uit, ja, uit te voeren zelf en alleen maar beloond te worden door: hé, je model is beter.

344
00:55:29.194 --> 00:55:37.254
Ja, dan, dan, dan zit je eigenlijk een beetje verslaafd aan het infuus van, van die acht sessies die dan draaien en, en alles beweegt en alles.

345
00:55:37.334 --> 00:55:45.874
Want als je heel veel experimenten doet, is er altijd wel iets om te bekijken. Uh, dus je merkt wel dat je heel actief aan het sturen bent.

346
00:55:45.894 --> 00:55:54.454
Dus het is ook een soort van baan geworden waar je gewoon inderdaad die acht sessies een beetje babysit, uh, en, en aanstuurt en, en dat, dat voelt heel raar.

347
00:55:54.494 --> 00:56:06.874
Want als software engineer van oudsher is mijn baan gewoon weg. En, en dat vond ik best wel interessant om te zien van: hé, ik ben zo gewend om dit natuurlijk zelf te doen en zes maanden geleden kon het niet en nu wel.

348
00:56:06.914 --> 00:56:20.114
En nu opeens is mijn hele werk weg. En, en dat vond ik wel een realisatie van: holy moly, dat, dat, het is allemaal zo snel gegaan en het is ook niet dat het anders gaat worden. Dit is gewoon de toekomst.

349
00:56:20.694 --> 00:56:25.204
Take it or leave it. En dat was voor mij wel een soort van: oh, dat is snel gegaan.

350
00:56:25.214 --> 00:56:37.674
En denk je dat dit, uh, dit, deze manier van werken, dus orkestreren, uh, van agents, orkestreren van proefjes als een soort head of research, dat dat generaliseert naar andere, ander kenniswerk.

351
00:56:37.714 --> 00:57:02.654
Want dat is een beetje waar Alexander en ik wekelijks, iedere, we raken het wekelijks wel een keer aan van: gaat nou wat we voelen en zien in die meer hard tech, uh, software scene, eh, en ook, uh, onderzoek, uh, zich inderdaad als een soort olievlek uitspreiden over al het werk wat te maken heeft met input output, oftewel informatie, creëren van tekst, creëren van PDF, research rapporten, et cetera.

352
00:57:02.714 --> 00:57:16.714
Hoe zit jij daarin? Ja, ik, ik vind het moeilijk, want, het, je kan eigenlijk niet meer, uh, het internet opgaan zonder dat je in twijfel trekt wat de authenticiteit is van, van content of wat je ook ziet.

353
00:57:16.794 --> 00:57:23.514
Dus eigenlijk ben ik daardoor gewoon niet meer actief op het internet. Dus het internet is wel een beetje dood voor jou.

354
00:57:23.954 --> 00:57:37.724
Nou ja, ik vind het gewoon heel moeilijk om door alle ruis heen een signaal te vinden waarvan ik denk van: dit vind ik vet. En, en je ziet het eigenlijk overal. En i-,

355
00:57:39.274 --> 00:57:52.534
ik lees liever een paper van een universiteit, weet ik veel waar, geschreven door iemand die de taal Engels zeker niet, uh, uh, heel goed kan. Maar

356
00:57:53.594 --> 00:58:06.214
ik vind het zo prettig om dan een spelfoutje te zien in die paper, omdat ik weet: oké, dit is gewoon geen AI slop. Hier heeft iemand gewoon wel een paar weken van zijn, of maanden van zijn of haar tijd aan uitgegeven. En

357
00:58:07.654 --> 00:58:21.254
tegenwoordig, als je veel papers leest of veel, ja, blogs of benchmark reports of wat dan ook, het is gewoon allemaal AI slop. En ik vind dat geen informatie meer, dat, dat is gewoon geen kennis.

358
00:58:21.294 --> 00:58:34.454
En je ziet het steeds vaker gebeuren waar bepaalde claims worden gedaan. Of neem bijvoorbeeld het, het hele, uhm ja, cloud skills, uh, uhm, concept waar dus mensen cloud skills met elkaar delen.

359
00:58:35.214 --> 00:58:49.354
En ik vind dat eigenlijk, ja, het zijn een paar markdowns, maar we worden in de hemel geprezen voor: wow, dat is vet! Terwijl, het, het is, het is, ja, het is niks. En, en ik denk dat ik daar heel veel moeite mee heb.

360
00:58:49.384 --> 00:58:57.594
Met, uhm, nou ja, dat, dat mijn waardering voor heel veel dingen eigenlijk een beetje is gedaald van, van, als je denkt aan, denk aan open source projecten.

361
00:58:58.314 --> 00:59:08.294
Ja, uh, de, de meeste open source projecten waar, waar ik groot fan van ben, zijn eigenlijk vernietigd door een influx van, van gevibe code pull requests en ook de maintainers.

362
00:59:08.334 --> 00:59:15.334
Ja, wat is nog het punt om een open source project te maintainen als, als er zoveel, ja, shit op je afkomt? Dus ik vind dat wel, ja.

363
00:59:15.374 --> 00:59:23.294
Hoe is dat voor jou dan als je, je bent, uh, ik, ik kan, ik projecteer het een beetje op jou nu. Laat ik het eerst over mezelf hebben en dan vraag ik het aan jou. Ik vind het,

364
00:59:25.154 --> 00:59:36.134
we zijn een onderdeel van iets, uh, van, van wat dan AI heet, waarin we ook zelf, ik praat er veel over, jij maakt veel, uh, AI-stukjes, infrastructuur.

365
00:59:36.734 --> 00:59:42.394
Terwijl binnen datzelfde grote fenomeen hebben we er ook last van en, en vinden we het ook eigenlijk best wel [gniffelt] irritant.

366
00:59:42.454 --> 00:59:48.694
Want mooie dingen die, die we waarderen als mooie open source projecten, belangrijke pijlers van het internet, noem allemaal maar op.

367
00:59:48.734 --> 01:00:01.474
Het feit dat mensen in hun vrije tijd als vrijwilliger projecten aan het maintainen zijn die letterlijk, uh, fundamenten vormen voor het hele internet, die nu overspoeld worden met matige, uh, waar het maar groeien, maar matige pull requests, matige ideeën.

368
01:00:02.294 --> 01:00:13.994
Hoe, hoe ga jij daarmee om dat het ook zo'n keerzijde heeft, dit hele verhaal? Ja, ik denk dat een beetje, ja, deels natuurlijk creëer ik het zelf.

369
01:00:14.014 --> 01:00:25.634
En ik creëer het zelf omdat ik juist zo'n groot niet-fan ben van natuurlijk ook, ja, deelnemen van het consumeren. Ja, weet je, een beetje moeilijk uit te leggen. Oké, wacht, ik ga het nog een keer proberen.

370
01:00:25.914 --> 01:00:38.954
Neem je tijd. Ik hou ervan om, zeg maar, op dit moment AI-modellen zelf te creëren, omdat het eigenlijk een beetje het laatste is wat je nog kan creëren.

371
01:00:39.594 --> 01:00:53.254
Als je er een beetje over nadenkt van: oké, dus code, dat kan AI creëren. Uhm, slides, decks, plannen, you name it, kan allemaal door LLM's worden gedaan. Matig, maar het kan worden gedaan.

372
01:00:53.274 --> 01:00:58.514
En ik denk als het nu matig is, dat betekent dat in de toekomst waarschijnlijk best wel goed gaat worden en uiteindelijk gewoon perfect.

373
01:00:58.614 --> 01:01:12.534
Ik dacht vroeger nog van: dit, twee jaar geleden zou ik nooit hebben gedacht dat, uhm, uh, een, een, een copilot of een, een code, uh, assistant, uh, in een CUDA kernel kan zeggen: hé, trouwens, dit kan drie keer sneller.

374
01:01:13.154 --> 01:01:15.824
Ik dacht: bullshit, had je nooit, nooit geloofd.

375
01:01:15.834 --> 01:01:29.794
Het is eigenlijk een beetje de laatste maanden, hè, dat de grote John Carmack van, uh, id Software destijds en, uh, Linus Torvalds, Linux, die allemaal nu aan het turnen zijn eigenlijk van: oké, we zijn een soort voorbij, we zijn post slop aan het raken.

376
01:01:29.874 --> 01:01:42.746
Ik zie gewoon daadwerkelijk tussen al die rommel sporadisch eenUh, p-uh, pull request of een idee voor, en een security, uh, uh, fix die gewoon best wel, best wel goed en ook best wel ingenieus en best wel creatief is, zeg maar.

377
01:01:42.796 --> 01:01:51.986
En jij maakt dat natuurlijk zelf ook mee. Het is, in dat opzicht ben je verbaasd of in ieder geval. Nou ja, ik, ik ben verbaasd dat dat dus gewoon opgelost is eigenlijk.

378
01:01:52.026 --> 01:02:00.746
Want we, de meest complexe dingen worden opgelost door, door Clad. En als je dan tegen me zegt van: ja, maar niet voor mijn use case, denk ik: ja, uiteindelijk wel.

379
01:02:01.006 --> 01:02:17.126
Uiteindelijk, hoe groot je codebase is, hoe oud het ook is, ik ben volledig overtuigd dat Clad of, hè, Codex of wat dan ook, uhm, uiteindelijk gewoon veel beter wordt dan wij ooit. Uhm,

380
01:02:18.566 --> 01:02:30.306
dus oké, dus, m-m-m'n favoriete ding: software engineering, dat is gewoon dood zoals ik het ken. En, en dat kan je natuurlijk ook naar, hè, dus, je kan dat vertalen naar mensen die blogposts schrijven of wat dan ook.

381
01:02:30.346 --> 01:02:40.166
En ik denk dus dat, ja, als ik AI-modellen zelf maak, dat is het enige wat eigenlijk AI-modellen nog niet volledig kunnen doen. Uhm, en de infra daarvan aanbieden en zelf de hardware kopen.

382
01:02:40.186 --> 01:02:48.626
En, hè, dus ik denk van: oké, dat is hetgeen wat eigenlijk nog niet door AI kan worden gedaan. Het zelf bouwen van die modellen, dat is.

383
01:02:48.746 --> 01:02:59.886
Je bent als het ware op zoek gegaan in een wereld waarin, nou ja, eigenlijk veel van het creëren van dingen, om het maar even zo te zeggen, aan alle kanten opgegeten wordt door algoritmes/generatieve modellen.

384
01:03:01.006 --> 01:03:12.446
Behalve het modellen maken zelf. Exact. Voor nu. Voor nu, ja. Hoe zit je daarin dan? Ik denk dat het. Wanneer komen ze naar jou [lacht]? Nou ja, dus daarom zijn we natuurlijk ook een infrastructuurspeler.

385
01:03:12.986 --> 01:03:25.486
We, we bieden de infra aan en ik denk natuurlijk het fysiek in datacenters schrijven van, van GPU's, het aanbieden van de inferencing laag, het personeel daaromheen natuurlijk nog steeds, uh, heel veel waarde heeft.

386
01:03:25.506 --> 01:03:27.406
En dat kan je natuurlijk niet makkelijk vervangen.

387
01:03:27.646 --> 01:03:36.446
Ja, ik sta natuurlijk, uh, wie weet wat er over vijf jaar gebeurt, uhm, maar ik heb wel veel meer waardering voor, voor dingen die niets meer te maken hebben met software.

388
01:03:37.226 --> 01:03:49.126
Ik vind het eigenlijk heel heerlijk om te zien hoe, natuurlijk, ja, ik als, als wat meer, nou tu-, teruggetrokken persoon natuurlijk in deze samenleving toch heel erg kan genieten van de fysieke dingen in onze wereld.

389
01:03:49.946 --> 01:03:59.846
Uhm, en ja, dan ga je toch kijken naar een bedrijf als Monumental. Natuurlijk supercool wat, wat zij doen. Natuurlijk het. Huizen bouwen met AI. Ja. Plat gezegd: gebouwen bouwen met AI.

390
01:04:00.046 --> 01:04:11.166
Maar ja, misschien dat we dan tien jaar later gaan we huizen vipe bouwen en, uh, uh, heb je opeens een huis. Wie weet. Maar ik heb daar wel veel meer waardering voor gekregen, uh, voor het echt.

391
01:04:11.946 --> 01:04:25.766
En dat eigenlijk het alles op het internet en alle software is zo maakbaar geworden. Vroeger kon je versteld kijken van features wat een bepaald SaaS-product je aanbieden en nu zie je letterlijk, uh, dat men

392
01:04:26.826 --> 01:04:38.186
gewoon de dingen bouwt die ze zelf willen. En, uh, de beste voorbeelden zijn ouders die voor kinderen apps vipe coden zodat ze beter kunnen leren op school.

393
01:04:38.966 --> 01:04:53.046
En dat wordt gewoon een ding waar later men, bedrijven op gaan turnen. Gewoon ouders, uh, gebruikers die gewoon denken: nee, ik wil een beter product, ik bouw het zelf en klaar. En dat, wat is dan nog de mode van SaaS?

394
01:04:53.846 --> 01:04:59.226
En ja, dan ga je vooral kijken naar de gereguleerde hoek. De, de hoek waar, waar compliance misschien belangrijk is.

395
01:04:59.346 --> 01:05:05.746
Maar ik denk dat er een heel groot probleem is voor aanbieders van SaaS die eigenlijk binnen nu vier dagen te vipe coden is.

396
01:05:06.846 --> 01:05:12.266
En dat doet natuurlijk, ge-, het product kan fantastisch zijn, het team kan fantastisch zijn, maar dat is wel gewoon de realiteit waar we nu in zitten.

397
01:05:13.746 --> 01:05:21.376
En jij bent, je bent nu een nieuw bedrijf begonnen, ook met al deze zaken die je net eventjes opnoemt in je achterhoofd. Dat jij ook hebt gedacht:

398
01:05:22.486 --> 01:05:34.986
ja, nu, ik zit, stel me even voor, hè, vroeger als jij een, uh, uit hout, uh, een stoel kon maken met ook nog in de rugleuning een complete afbeelding van een vos in een bos, hè, met de hand eruit gekarfd, zeg maar, dan was dat impressive.

399
01:05:35.426 --> 01:05:44.606
Nu kunnen mensen CNC-machines aanschaffen en dan CNC't die computer 10 van die stoelen per, per uur. Dus als jij daarmee de straat binnen komt lopen, zeggen mensen: oh, heb je ook een CNC-machine gekocht?

400
01:05:44.666 --> 01:05:51.705
Cool man, whatever. Hè, dus dat daar soort van, de waardering ervan is eraf. Jij zegt eigenlijk nu: ik ben CNC-machines aan het maken.

401
01:05:52.086 --> 01:06:02.846
Hè, of, of, ik ga, ik ga op een andere plek zitten in het ecosysteem, maar misschien is CNC-machine nog, doet je nog wel tekort. Uh, kan je een beetje, a-uitleggen waar jij je nu hebt gepositioneerd dan?

402
01:06:02.876 --> 01:06:12.646
Waar je het idee van hebt dat je wat, wat meer adem, ademruimte hebt, zeg maar, langere adem dan de gemiddelde SaaS die in vier dagen met jouw woorden kan na-, kan namaken.

403
01:06:13.106 --> 01:06:25.206
Nou ja, i-ik denk dat het bouwen van de foundational models voor de toekomst, uh, sowieso heel belangrijk zijn voor de, o-Europese talen. En er zijn weinig spelers die dit doen.

404
01:06:25.826 --> 01:06:39.506
Als je kijkt naar, natuurlijk Mistral doet het best wel, uhm, actief. Uh, Voxtral is een mooi voorbeeld, maar ook daar merk je: ja, de Nederlandse taal is toch wat minder. Benchmarks supergoed, praktijk stuk minder.

405
01:06:40.266 --> 01:06:51.046
Uhm, en dan zie je ook gelijk het gevaar van, van benchmarks daarin terug. En er zijn natuurlijk ook andere, uh, speech-to-text providers. Uhm, maar wij willen het verschil zijn in Europa.

406
01:06:51.146 --> 01:07:04.306
Wij willen de speler zijn die tenminste ervoor heeft gezorgd dat over drie jaar, waar spraakherkenning wordt gebruikt, dat ook de Nederlandse taal gewoon nog steeds goed, uh, ga, nou, nou, gewoon heel goed is. Uhm.

407
01:07:05.246 --> 01:07:12.926
Waarom ben je eigenlijk niet daar, uh, naar DeepMind gegaan of naar Anthropic? Waarom ben je nou een bedrijf gestart? Nou, ik vind het gewoon superleuk. Nee, ja,

408
01:07:13.826 --> 01:07:27.126
i-ik ben vooral een eigen bedrijf gestart omdat het gewoon, lo-, het voelt logisch. Het voelt gewoon goed. Het voe-- ik kan me niets anders voorstellen. Het is niet eens een actieve keuze. Uhm.

409
01:07:27.136 --> 01:07:37.166
Maar goed, dat bedrijf had je ook in, uh, Silicon Valley kunnen starten. Ja, en ik, ik hoor wel eens vaker van: oké, ja, Europa is een slecht klimaat of Amerika, daar moet je zijn.

410
01:07:37.706 --> 01:07:49.896
Ja, als ik heel eerlijk ben, als ik nu naar buiten kijk, zie ik gewoon, ja, het is prachtig weer. Uhm.Ik kan zo intens genieten van in Nederland zijn en dat heeft helemaal niks te maken met de politiek.

411
01:07:49.936 --> 01:08:03.316
Dat heeft niets te maken met het investeringsklimaat. Dat heeft niks te maken met het beleid. Ik hou gewoon van in Nederland zijn en dat is mijn factor. En je kan het complexer maken.

412
01:08:03.356 --> 01:08:14.896
Je kan het moeilijker maken dan dat, maar dat is gewoon de waarheid. En of het nou fiscaal aantrekkelijk is of wat dan ook, je krijgt mij hier gewoon niet weg en dat lijkt mij gewoon. Ja,

413
01:08:16.476 --> 01:08:28.376
ik zie dat daar heel moeilijk over wordt gedaan van oké. Hoe bedoel je dat? Misschien de, de. We hebben over box drie belasting hebben natuurlijk. Hebben mensen het nu heel erg actief over. Over het investeringsklimaat.

414
01:08:28.436 --> 01:08:34.376
Dat het hier allemaal beter moet worden, dat we meer moeten samenwerken, dat. Dat de politiek van alles moet doen voor startups.

415
01:08:34.836 --> 01:08:44.596
Ik denk gewoon als je in Nederland woont en je wil een startup, dan heb je volledige keuze waar je je startup op richt. En als het in Nederland is, dan is het in Nederland en is Amerika sinds Amerika.

416
01:08:45.436 --> 01:08:53.556
Maar je moet die keuze zelf maken. En ik denk dat geen enkel beleid of fiscaal of niet fiscaal of wat dan ook daar een rol in moet spelen.

417
01:08:54.316 --> 01:09:05.076
Ik denk het enige waar je natuurlijk last van gaat hebben, van beleid en of wat dan ook bij het aannemen van talent. Want ja, als je ergens. Hoe doe jij dat nu dan? Aannemen van talent naast je cloud agents.

418
01:09:06.096 --> 01:09:17.896
Hoe we dat nu doen is vooral ons best doen om mensen mee te nemen met de visie dat we gewoon het beste spark recognition lab willen zijn van Europa.

419
01:09:20.276 --> 01:09:26.956
Deels ook zeer competitief zijn in de salarissen die we kunnen aanbieden. Dat is natuurlijk wel het mooie met geld ophalen.

420
01:09:27.016 --> 01:09:41.416
Het geeft je de kans om ook heel goed talent aan te trekken, omdat je ze ook kan belonen voor het talent wat ze hebben. Dus voorheen is dat best wel moeilijk geweest, omdat als je kijkt naar wat de salarissen zijn bij,

421
01:09:42.656 --> 01:09:51.476
ja, in de zijde als bij bijvoorbeeld de, de, de, de high frequency trading bedrijven, ja, die liggen behoorlijk hoog, maar het zijn ontzettend goede software engineers die daar werken. En hoe krijg je die daar weg?

422
01:09:51.516 --> 01:10:00.956
Ja, deels die visie, maar ook natuurlijk het kunnen matchen op salaris is natuurlijk heel belangrijk. En nog hebben natuurlijk is het gewoon moeilijk. Je hebt hele mooie bedrijven in Europa

423
01:10:02.136 --> 01:10:13.836
waar het ook heel vet is om te werken, maar als je een. Ja, voor ons stadium werk je alleen denk ik bij ons als je in de visie in de langer termijn gelooft van oké, wij willen in Amsterdam

424
01:10:15.136 --> 01:10:28.136
het toonaangevende spark recognition lab hebben in Europa en als je daar bij aansluit, ja dan, dan ben je van harte welkom. Maar talent is altijd een beetje denk ik een vliegwiel. Je moet

425
01:10:29.996 --> 01:10:39.696
hele vette dingen doen om vervolgens natuurlijk de aandacht en de spotlight te kunnen krijgen. Om vervolgens weer mensen aan te nemen om daar weer hele vette dingen mee te doen. En zolang je dat.

426
01:10:39.836 --> 01:10:54.356
Zolang dat dat wiel blijft draaien en steeds sneller gaat, denk ik dat talent je wel zal vinden. Dus op dit moment zijn we nog best wel klein, maar wie weet wat hoe groot we worden in de toekomst. Dank je wel man.

427
01:10:54.936 --> 01:10:57.426
Ja, mooi gesprek. [muziek].
