Paper

Auditing Language Models for Hidden Objectives

Anthropic · 2025 · arXiv:2503.10965

Read the paper →

auditingdeceptionalignmentmech-interp

Discussed in