OpenAI Releases a Model Misalignment Disclosure Framework With 3 Review Tracks and 6 Incident Reports From RL Training
OpenAI has released a new framework for tracking, investigating, and disclosing misalignment in its own models. The OpenAI team announced…
