Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication

By Ramneet Kaur · Paper · cs.AI

Language-model agents can communicate through continuous hidden states that are invisible in public transcripts, creating opportunities for covert harmful coordination. We introduce Verifiable Latent Alignments (VLA), an activation-aware framework for monitoring and steering thes

Cs.ai

View original

HomeResourceLoading…