Paper

Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors

· 2025 · arXiv:2512.11949

Read the paper →

deceptionmech-interpmonitoring