OpenAI reveals AI models tried to bypass safeguards, hide mistakes
OpenAI on Wednesday disclosed six reports detailing “unexpected or concerning” model behavior as the debate over artificial intelligence safety intensifies. In a research and safety blog post, “Our framework for reporting model misalignment,