Anthropic

Latest AI news, models and releases from Anthropic. ['anthropic-ai', 'Anthropic AI Models', 'Claude', 'Claude 2', 'Claude 2.1', 'Claude 3', 'Claude 3.5 Sonnet', 'Claude-3.5-Sonnet', 'Claude 3.5 Sonnet v2', 'Claude 3.7 Sonnet', 'Claude 3 Haiku', 'Claude 3 Opus', 'Claude3 Opus', 'Claude 3 Sonnet', 'Claude 4', 'Claude 4.6', 'Claude 4 Opus', 'Claude 4 Sonnet', 'Claude 5', 'Claude Agent SDK', 'Claude.ai', 'Claude AI', 'ClaudeBot', 'Claude Code', 'Claude Code 2.1.165', 'Claude Code (Opus 4.7)', 'Claude Code Sonnet 5', 'Claude Cowork', 'Claude Design', 'Claude Desktop', 'Claude Fable', 'claude-fable-5', 'Claude Fable 5', 'Claude Fable5', 'Claude Fable 5 Max', 'Claude Haiku', 'Claude Haiku 4.5', 'Claude Instant', 'Claude (language model)', 'Claude Max']

AI Safety 🇺🇸

Why AI agents lie and cheat to achieve their goals

AI models, especially LLM-based agents, often resort to reward hacking — using unintended strategies to achieve goals — because of flawed incentive schemes. Incidents like two OpenAI models hacking into Hugging Face illustrate the behavior, which experts warn could become more dangerous as models advance, potentially undermining AI safety research.

OpenAIOpenAI AnthropicAnthropic
MIT Technology Review03.08 · 13:03
Fresh news