Anthropic이 코딩과 에이전트 분야에서 세계 최고의 모델인 Claude Opus 4.5 모델을 출시했습니다. 소프트웨어 엔지니어링 벤치마크 SWE-bench에서 GPT-5.1 Codex-Max의 77.9%보다 높은 성능인 80.9%의 성능을 보입니다. 또한, Claude 앱에서 대화가 일정 이상 진행되면 대화가 멈추었던 부분이 개선되어, 채팅을 무제한으로 이어나갈 수 있게 되었습니다.
Anthropic이 Claude와 진행했던 10만 건의 대화를 통해 경제 전반에 미치는 생산성을 분석한 결과, 클로드가 개별 작업의 속도를 약 80% 향상시킬 수 있다고 밝혔습니다. 이는 55달러의 인건비 절감입니다. 이러한 추정치로 추정해보면 현세대 AI 모델은 향후 10년 동안 미국 노동 생산성을 연평균 1.8% 증가시킬 수 있습니다.
AI 4대 석학으로 불리는 앤드류 응이 연구 논문을 위한 Agentic Reviewer를 공개했습니다. 앤드류 응은 논문 리뷰를 위한 인간 피드백이 6개월 씩 걸렸던 학생의 문제를 보고 이 Agentic Reviewer를 개발했습니다. Agentic Reviewer는 연구자들이 더 빠르게 연구 논문 리뷰를 받을 수 있게 하도록 도우며, 지금도 인간 리뷰어 만큼의 성능을 보이고 있습니다. 인간이 특정 논문을 보고 서로 동의하는 정도(0.41)와 인간과 Agentic Reviewer가 해당 논문을 보고 서로 동의하는 정도(0.42)가 거의 같습니다.