När flera AI-agenter fick motstridiga instruktioner i samma mjukvaruprojekt började de motarbeta och sabotera varandra. Det visar nya tester från Anthropic om hur autonoma agenter beter sig när de delar system och resurser.
AI-agenter saboterade för varandra i Anthropic-test

Någonting är fel
Du är inloggad som prenumerant hos förlaget Pauser Media, men nånting är fel. På din profilsida ser du vilka av våra produkter som du har tillgång till. Skulle uppgifterna inte stämma på din profilsida – vänligen kontakta vår kundtjänst.
Techtidningen premium
Läs vidare – starta din prenumeration
Redan prenumerant? Logga in och läs vidare.
I ett experiment fick tre Claude-agenter arbeta parallellt utan att veta att andra agenter var aktiva. Enligt forskarna tolkade modellerna de andras agerande som avsiktliga hinder och konflikten eskalerade till att agenterna skrev skadlig kod för att slå ut varandras arbete.
Studien visar samtidigt att agenter ibland kunde upptäcka målkonflikten, kommunicera och nå vapenvila. I andra tester uppstod bland annat konformitet och prissamordning mellan agenter.
Anthropic varnar för att sådana gruppbeteenden kan skapa nya risker när multiagentsystem börjar användas i delade kodmiljöer, marknader och andra it-system.
