AI-agenter saboterade för varandra i Anthropic-test

AI-agenter saboterade för varandra i Anthropic-test
Foto: Adobe stock.

När flera AI-agenter fick motstridiga instruktioner i samma mjukvaruprojekt började de motarbeta och sabotera varandra. Det visar nya tester från Anthropic om hur autonoma agenter beter sig när de delar system och resurser.

Någonting är fel

Du är inloggad som prenumerant hos förlaget Pauser Media, men nånting är fel. På din profilsida ser du vilka av våra produkter som du har tillgång till. Skulle uppgifterna inte stämma på din profilsida – vänligen kontakta vår kundtjänst.

I ett experiment fick tre Claude-agenter arbeta parallellt utan att veta att andra agenter var aktiva. Enligt forskarna tolkade modellerna de andras agerande som avsiktliga hinder och konflikten eskalerade till att agenterna skrev skadlig kod för att slå ut varandras arbete.

Studien visar samtidigt att agenter ibland kunde upptäcka målkonflikten, kommunicera och nå vapenvila. I andra tester uppstod bland annat konformitet och prissamordning mellan agenter.

Anthropic varnar för att sådana gruppbeteenden kan skapa nya risker när multiagentsystem börjar användas i delade kodmiljöer, marknader och andra it-system.

Senaste artiklarna

Hämtar fler artiklar
Till startsidan
Techtidningen

Techtidningen Premium

Nyhetstjänsten för dig som jobbar med professionell kommunikation. Få nischade nyhetsbrev för ditt intresseområde och utbildnings-tv.