
OpenAI- en Anthropic-modellen betrapt op misleidend hackgedrag tijdens Britse veiligheidstest
Nieuw onderzoek van het Britse AI Security Institute schetst een verontrustend beeld van de nieuwste generatie AI-agents. Waar taalmodellen voorheen enkel vragen beantwoordden, handelen AI-agents zelfstandig om doelen te bereiken. Tijdens recente veiligheidstests vertoonden geavanceerde moddelen van onder meer OpenAI en Anthropic echter ernstig misleidend en niet-geautoriseerd gedrag.