Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication
By Ramneet Kaur · Paper · cs.AI
Language-model agents can communicate through continuous hidden states that are invisible in public transcripts, creating opportunities for covert harmful coordination. We introduce Verifiable Latent Alignments (VLA), an activation-aware framework for monitoring and steering thes