jsonscraper

Deze week in AI-infrastructuur: agenten krijgen waarborgen, evaluaties en een goedkoper model

Vier aankondigingen van 17–23 september belichten de infrastructuur rond AI-agenten: verificatie, codebeveiliging, observeerbaarheid en modeleconomie.

Vier ontwikkelingen van 17–23 september 2026 laten zien dat de agentenstack verder reikt dan modellen: toegangsbeheer, beveiligingscontroles en manieren om te meten wat agenten daadwerkelijk doen.

De behandelde periode loopt inclusief van 17 tot en met 23 september 2026. Vier afzonderlijke aankondigingen sprongen eruit voor ontwikkelaars en teams die geautomatiseerde workflows bouwen. De rode draad is praktisch: naarmate AI-systemen langere of ingrijpendere taken uitvoeren, is de omliggende infrastructuur — wie toegang krijgt, hoe acties worden gecontroleerd en of een wijziging de prestaties verslechtert — net zo belangrijk als de mogelijkheden van het model.

17 september: Anthropic opent een verificatieprogramma voor teams in de biowetenschappen

Anthropic introduceerde zijn verificatieprogramma voor biowetenschappen, dat geverifieerde organisaties in de biowetenschappen toegang biedt tot de modellen Mythos, Opus en Sonnet, met waarborgen die volgens het bedrijf meer ruimte bieden voor biologisch onderzoek. Het programma bevindt zich in de bètafase en is aanvankelijk bedoeld voor teams en instellingen. Aanvragen worden beoordeeld op onderzoekskwalificaties, beveiligingsnormen en ethisch toezicht; goedgekeurde teams kunnen verschillende toegangsniveaus aanvragen. Het programma is te gebruiken via Claude-producten en de API. (het programma van Anthropic)

Waarom dit belangrijk is: Dit is een concreet voorbeeld van hoe toegang wordt bepaald door het opgegeven doel en de beheersmaatregelen van een organisatie, niet alleen door de modelkeuze van een gebruiker. Voor ontwikkelaars die gespecialiseerde AI-workflows bouwen, reikt de ontwerpvraag verder dan ‘Kan het model dit?’ Het gaat ook om: ‘Wie mag het gebruiken, onder welke beoordeling en met welk toezicht?’

Anthropic wijst ook op risico’s zoals gecompromitteerde toegang en onbedoelde acties van agenten die in zwermen of gedurende lange taken werken. Daardoor is het programma ook buiten de biowetenschappen relevant: het laat zien welk bestuursvraagstuk ontstaat wanneer een API-aanroep onderdeel wordt van een systeem dat meerdere stappen kan uitvoeren. De aankondiging beschrijft de aanpak van het programma, maar toont niet aan hoe goed de waarborgen op grote schaal zullen werken. (Anthropics beschrijving van het programma)

18 september: Google beschrijft continue, door agenten ondersteunde beveiligingsscans

De broncode van het gratis, responsieve WordPress-thema Fruitful wordt op deze foto weergegeven; je kunt het gratis downloaden op wordpress.org of hier de PRO-versie aanschaffen https://goo.gl/hYGXcj
Ilya Pavlov

Het infrastructuurteam van Google schetste een aanpak om codewijzigingen met AI-agenten te beoordelen voordat ze worden ingediend, in plaats van uitsluitend te vertrouwen op omvangrijke, periodieke beveiligingsscans. Volgens de beschrijving van het systeem gebruiken de scanners actuele metadata van de codebase en aanroepgrafieken van afhankelijkheden om een gerichtere dreigingscontext op te bouwen. Google meldt dat het systeem maandelijks honderden kwetsbaarheden tegenhoudt voordat ze de codebase of productie bereiken, en zegt dat het aantal foutpositieven in sommige gevallen is gedaald tot 3%. Dit zijn resultaten die door het bedrijf zelf zijn gemeld, geen onafhankelijke audit. (Googles uitleg over de aanpak)

De praktische les gaat minder over het kopiëren van Googles schaal en meer over wanneer en waar controles worden uitgevoerd. Elke codewijziging beoordelen kan een beveiligingstool een beperktere context bieden dan een enorm systeem in één keer scannen. Google zegt de opensource-beoordelingsharnas Mantis voor dit werk te hebben doorontwikkeld en noemt dreigingsmodellen en een harnas met meerdere agenten als onderdelen van de aanpak. Teams die vergelijkbare workflows overwegen, moeten de gemelde resultaten zien als een casestudy, niet als een prestatiebelofte: hun eigen repositories, dreigingsmodellen en beoordelingsproces bepalen of scannen met agenten nuttige problemen opspoort zonder de ontwikkeling te vertragen. (Googles beschrijving van de beveiligingsaanpak)

22 september: AWS introduceert een workflow voor observeerbaarheid van AI-agenten

Prestatieanalyses van Speedcurve
Luke Chesser

AWS kondigde CloudWatch Omni aan, een hulpmiddel om workloads met agenten te observeren, evalueren en testen. Volgens AWS kunnen teams traces inspecteren, versies van prompts vergelijken, testdatasets opbouwen uit productieverkeer en experimenten uitvoeren met verschillende configuraties. Het bedrijf noemt VS Code- en Kiro-extensies voor ontwikkelaars, plus een afzonderlijke webervaring voor operators. (de aankondiging van AWS)

Dit richt zich op een probleem dat conventionele dashboards voor uptime mogelijk missen: een workflow kan succesvolle reacties opleveren en toch minder bruikbaar worden na een wijziging van een prompt, model of tool. AWS noemt ingebouwde evaluatoren voor aspecten zoals correctheid, samenhang, kwaliteit van informatieophaling en toolselectie. Voor engineeringteams is de belangrijke verschuiving dat wijzigingen aan een agent worden behandeld als wijzigingen aan software: uitvoeringen vastleggen, taakspecifieke controles definiëren en regressies opsporen voordat de uitrol wordt uitgebreid.

De beschrijving van de lancering toont niet aan hoe goed die evaluatoren aansluiten op de behoeften van elk team. Een algemene score voor correctheid vervangt geen domeinspecifieke tests, en tracering laat op zichzelf niet zien of de acties van een agent gepast waren. Teams moeten nog steeds bepalen wat succes betekent voor hun specifieke workflow. (AWS’ beschrijving van CloudWatch Omni)

22 september: Anthropic benadrukt bij Opus 5.5 zowel de kosten als de mogelijkheden

Anthropic kondigde Claude Opus 5.5 aan en zegt dat het model bij de meeste taken presteert op het niveau van Claude Fable 5.1, terwijl het 40% minder kost om te gebruiken dan Opus 5. Volgens het bedrijf is het model beschikbaar via zijn platform en verschillende cloudproviders, en kunnen ontwikkelaars er via de Claude API toegang toe krijgen. Deze vergelijkingen en kostenclaims zijn afkomstig van Anthropic zelf; ze moeten worden getoetst aan de daadwerkelijke workloads van elk team en niet worden gezien als gegarandeerde besparingen. (Anthropics informatie over Opus)

Voor bouwers van agenten is de prijs per uitvoering slechts één onderdeel van de berekening. Een nuttige vergelijking omvat ook taaksucces, latentie, herhalingen, toolaanroepen en de hoeveelheid menselijke correctie die nodig is. Een model dat per token minder kost, verlaagt mogelijk niet de totale kosten van een workflow als het meer stappen nodig heeft of meer herstelbare fouten maakt. De aankondiging is een reden om alternatieven te benchmarken, niet om productieverkeer zonder evaluatie over te zetten.

De conclusie: de agentenstack wordt een operationeel vraagstuk

Deze aankondigingen richten zich op verschillende lagen: gecontroleerde toegang voor gespecialiseerd werk, beveiliging van codebeoordeling, observeerbaarheid van agenten en modeleconomie. Samen wijzen ze op een praktische prioriteit voor bouwers: maak het gedrag van agenten controleerbaar en toetsbaar voordat je hun autonomie vergroot. Beperk machtigingen, leg toolgebruik vast, evalueer representatieve taken en vergelijk modelwijzigingen met een uitgangsmeting.

Het is nog onzeker hoe deze aanbiedingen presteren bij onafhankelijke workloads. Aankondigingen bij de lancering en resultaten die leveranciers zelf melden, zijn nuttige signalen, maar vervangen de eigen tests van een team niet. Voor ontwikkelaars is de volgende stap eenvoudig: behandel elke workflow met agenten als een systeem met meetbare uitkomsten, niet als een prompt die je kunt vertrouwen omdat er een aannemelijk antwoord uitkwam.

Gerelateerde artikelen

Abonneer u op productupdates

Ontvang releaseopmerkingen, nieuwe eindpuntklassen en integratie-updates in uw inbox.

Door u te abonneren, gaat u akkoord met ons Privacybeleid. U kunt zich op elk gewenst moment afmelden.