Naar de inhoud
Terug naar overzicht
AI NieuwsEnterpriseGovernanceOpen source

Thomson Reuters bouwt zijn eigen model voor 40 miljoen dollar

·Door
Thomson Reuters bouwt zijn eigen model voor 40 miljoen dollar

Een uitgever van juridische naslagwerken heeft zijn eigen taalmodel gebouwd. Niet een laagje bovenop ChatGPT, geen fijnafstemming van een API die iemand anders bezit. Een model dat van hen is, gebouwd voor ongeveer 40 miljoen dollar aan mensen en rekenkracht over twee jaar.

Het heet Thomson, en het is getraind op Westlaw, Practical Law, Checkpoint en de archieven van Reuters. Dat is de vijver waar geen enkel ander lab in mag vissen.

"Start with a strong foundation, specialize it deeply for the work that matters, and you can build intelligence that is highly capable, far more efficient and entirely under your control."

— Joel Hron, Chief Technology Officer bij Thomson Reuters (persbericht)

Veertig miljoen, waarvan 450.000 aan de eindsprint

Het bedrag valt uiteen in twee heel verschillende getallen. Veertig miljoen dollar ging op aan salarissen en rekenkracht over twee jaar. De laatste trainingsronde, de run die het uiteindelijke model opleverde, kostte 450.000 dollar. Dat meldt The Decoder.

Bijna alles zit dus in de mensen, de data en de aanloop. Het trainen zelf is de goedkoopste stap geworden.

De basis is Qwen van Alibaba, laatstelijk de versie met 397 miljard parameters. Thomson Reuters hertrainde dat Chinese model eerst samen met Imperial College London op veiligheid, ethiek en politieke neutraliteit. Die tussenversie kreeg de naam Snowdon, naar de berg in Wales. Pas daarna gingen de eigen archieven erop.

De opgeschreven kennis was al van hen

Wat dit mogelijk maakt is niet het geld maar de inhoud. Westlaw en Practical Law zijn decennia aan geredigeerde juridische kennis, met verwijzingen, annotaties en handboeken erbij. Een lab dat het open web afstruint krijgt die kwaliteit niet, en mag er in veel gevallen ook niet bij.

Hoogleraar Jonathan H. Choi van Washington University School of Law testte het model en gaf aan dat hij de antwoorden van Thomson over de hele linie prettiger vond, vooral door de links naar handboeken die het meegaf.

Opvallend: het bedrijf zegt tot nu toe minder dan een tiende van zijn eigen inhoudsbibliotheek te hebben gebruikt.

Wat er niet bij zit, zijn scores. Het persbericht schrijft dat Thomson "on par" presteert met de nieuwste topmodellen, zonder één benchmarkgetal. De pers is het er ook niet over eens: The Decoder schrijft dat het model op standaardtests achterblijft bij GPT-5.5 en Gemini 3.1 Pro, terwijl LawSites uit hetzelfde materiaal opmaakt dat het er juist bovenuit komt. Tot er cijfers op tafel liggen, is dat marketing.

Huren of kopen

Interessanter dan het model is de rekensom eronder. Hron omschreef het tegenover The Decoder als het verschil tussen huren en kopen: je bouwt vermogen op in iets dat van jou is, en dat stapelt zich op.

Dat klopt, en het is ook precies waar de meeste organisaties het pad verlaten. Veertig miljoen en twee jaar is geen MKB-project. Het rekent alleen uit als je iets bezit dat niemand anders heeft, in dit geval een archief waar advocaten al veertig jaar voor betalen.

De vraag om mee te nemen is dus niet of jij een eigen model gaat trainen. Die vraag is: welk deel van jouw waarde zit in data die alleen jij hebt, en wie heeft daar nu toegang toe? Elke offerte, elk servicerapport, elke geannoteerde casus die je door een API van een ander duwt, is materiaal waarmee straks iemand anders zijn model beter maakt. Je hoeft geen model te bouwen om dat te regelen. Je moet weten wat je hebt.

Volgende Stap

Zet twee dingen op papier voor je volgende AI-project. Eén: welke datasets in je organisatie uniek zijn, in de zin dat een concurrent ze niet kan kopen of scrapen. Twee: wat er in het contract van je huidige AI-leverancier staat over training op jouw invoer, en of je die knop zelf kunt omzetten.

Weet je het antwoord op de tweede vraag niet uit je hoofd, dan is dat het antwoord. Wil je dat een keer goed uitzoeken voor de systemen die je nu gebruikt, neem contact op.

Headerbeeld: Thomson Reuters.

Hoe AI-ready is jouw organisatie?

Doe de gratis AI-Readiness Scan: 9 vragen, 2 minuten, direct een persoonlijk advies.