Tóm lại
- Claude Opus 5, được phát hành vào ngày 24 tháng 7, có giá 5 USD trên một triệu mã thông báo đầu vào — giống hệt với phiên bản tiền nhiệm Opus 4.8 và chỉ bằng một nửa giá của Fable 5 — trong khi vượt trội hơn Fable 5 trên hầu hết các điểm chuẩn chính.
- Opus 5 đạt 43,3% trên Frontier-Bench v0.1, một bài đánh giá mã hóa tác nhân, so với 33,7% cho Fable 5 và 34,4% cho GPT-5.6 Sol của OpenAI; trên ARC-AGI-3, một tiêu chuẩn giải quyết vấn đề mới, nó đạt 30,2% so với 7,8% của GPT-5.6 Sol—một khoảng cách không hề gần.
- Mô hình mới là mô hình mặc định trên Claude Max và mạnh nhất trên Claude Pro, thay thế Fable 5 một cách hiệu quả như lựa chọn phù hợp cho hầu hết người đăng ký.
Claude Opus 5 là hôm nay ra ngoài. Việc vận hành các doanh nghiệp sẽ rẻ hơn so với mô hình hàng đầu của Anthropic, Claude Fable 5, mà công ty đã định vị là sản phẩm tiên phong hàng ngày dành cho người dùng trả tiền. Hơn nữa, Opus 5 còn vượt trội hơn nó ở những điểm chuẩn quan trọng.
Để hiểu Opus 5 phù hợp ở đâu: Đội hình của Anthropic có bốn cấp độ. Haiku nhanh và rẻ. Sonnet là tầm trung. Opus là con ngựa nặng nhọc. Phía trên đó là lớp Mythos—một cấp độ Anthropic được giới thiệu vào mùa xuân này—bao gồm Truyện ngụ ngôn Claude 5 dành cho công chúng và Claude Mythos 5, một phiên bản có ít hạn chế hơn được dành riêng thông qua Project Glasswing dành cho các nhà nghiên cứu an ninh mạng và nhà điều hành cơ sở hạ tầng quan trọng đã được kiểm duyệt.
Fable 5 đã có một thời gian hoạt động khó khăn với tư cách là người đăng ký hàng đầu. Nó ra mắt vào ngày 9 tháng 6, kéo trên toàn cầu ba ngày sau sau khi chính phủ Hoa Kỳ ban hành lệnh kiểm soát xuất khẩu khẩn cấp với lý do có lỗ hổng bẻ khóa và đã trở lại vào ngày 30 tháng 6—chỉ để chuyển ngay sang mô hình chỉ có tín dụng, không còn nằm trong các gói tiêu chuẩn nữa. Opus 5 hiện đã lấp đầy chỗ trống mà Fable 5 không thể giữ được.
Lovable, một nền tảng dành cho nhà phát triển với hàng triệu người dùng, đã chạy Opus 5 trong các đánh giá nội bộ và ghi nhận những lợi ích đạt được vượt xa cả điểm thô: “Nó không chỉ tốt hơn trong các tác vụ mã hóa tác nhân khó nhất của chúng tôi, tăng 22% so với Opus 4.7, mà còn ổn định hơn, với ít sai số khi chạy hơn,” Fabian Hedin cho biết trong một tuyên bố được chia sẻ bởi Anthropic.
Các điểm chuẩn

Nghe có vẻ lạ, nhưng Opus đánh bại Fable ở hầu hết mọi thứ quan trọng đối với người dùng hàng ngày trong khi không bị gắn mác là lớp Thần thoại như Fable.
Trên Frontier-Bench v0.1—điểm chuẩn kiểm tra xem tác nhân mã hóa AI có thể hoàn thành các nhiệm vụ kỹ thuật phần mềm thực tế từ đầu đến cuối hay không, được tính điểm theo phần trăm nhiệm vụ đã vượt qua—Opus 5 đạt 43,3%. Truyện ngụ ngôn 5 đạt 33,7%. GPT-5.6 Sol của OpenAI, đối thủ thương mại chính của Anthropic, đạt 34,4%.
Biên độ rộng nhất là trên ARC-AGI-3, một bài kiểm tra khả năng giải quyết vấn đề thực sự được xây dựng xung quanh các câu đố mới mà một mô hình không thể ghi nhớ từ dữ liệu huấn luyện, được tính điểm theo phần trăm câu đố được giải. Opus 5 đạt 30,2%; GPT-5.6 Sol đạt 7,8%; và Fable 5 chưa hề được thử nghiệm. Trên GDPval-AA v2—điểm chuẩn công việc tri thức được tính điểm thông qua xếp hạng Elo, hệ thống xếp hạng kiểu cờ vua được sử dụng để đo lường hiệu suất tương đối trong các nhiệm vụ chuyên môn thực tế—Opus 5 đạt 1.861 so với 1.747 của Fable 5 và 1.736 của GPT-5.6 Sol.
Zapier đã thử nghiệm Opus 5 trên AutomationBench, một bài đánh giá đánh giá xem liệu một mô hình có thể thực hiện toàn bộ quy trình công việc từ đầu đến cuối mà không cần sự trợ giúp của con người hay không. Phán quyết của họ: mô hình “đã lấy sổ làm việc về tình trạng tài khoản thô và chạy toàn bộ chuỗi ngăn chặn từ đầu đến cuối: gắn cờ các tài khoản có nguy cơ, cảnh báo cho chủ sở hữu phù hợp và tóm tắt các hoạt động lưu giữ. Các mô hình trước đó không vượt qua; Opus 5 đạt 100%.”
Anthropic cũng đang giới thiệu Opus 5 như một bản nâng cấp nghiên cứu. Ultima Genomics, một công ty giải trình tự DNA, cho biết mô hình này “hoạt động giống như một nhà khoa học cẩn thận hơn bất kỳ mô hình nào chúng tôi đang chạy. Nó đạt được các thử nghiệm thống kê phù hợp để loại trừ các yếu tố gây nhiễu, kiểm tra chéo kết quả của chính nó bằng các phương pháp độc lập và luôn đi đúng hướng thông qua các phân tích dài nhiều bước.”
Điều đó nói lên rằng hai lĩnh vực này — pháp lý và sức khỏe — là những lĩnh vực duy nhất mà Fable 5 vượt trội hơn một chút.
Bản phát hành diễn ra một tuần sau khi Moonshot AI, một công ty khởi nghiệp có trụ sở tại Bắc Kinh được Alibaba hậu thuẫn, công bố Kimi K3—một mô hình trọng lượng mở có 2,8 nghìn tỷ tham số (có nghĩa là bất kỳ ai cũng có thể tải xuống mã cơ bản để chạy nó một cách độc lập) mà Moonshot mô tả là hệ thống AI mở lớn nhất thế giới. Các điểm chuẩn độc lập liên tục xếp Kimi K3 ở vị trí thứ ba chung cuộc, sau cả Fable 5 và GPT-5.6 Sol, đánh bại hai đối thủ đó trong các lĩnh vực cụ thể.
Opus 5 hiện có sẵn thông qua API với mức giá 5 USD trên một triệu mã thông báo đầu vào và 25 USD trên một triệu đầu ra. (Mã thông báo là đơn vị thông tin cơ bản mà mô hình AI có thể xử lý ở cả đầu vào và đầu ra). Chế độ Nhanh chạy với tốc độ gấp khoảng 2,5 lần tốc độ mặc định cũng có sẵn, với mức giá cơ bản gấp đôi—10 USD trên một triệu mã thông báo đầu vào và 50 USD trên một triệu đầu ra.
Bản phát hành này có thể chấm dứt nỗi lo lắng về việc Fable 5 không được cung cấp rộng rãi. Opus cũng có sẵn thông qua đăng ký cho tất cả mọi người.
Bản tin tóm tắt hàng ngày
Bắt đầu mỗi ngày với những tin tức hàng đầu ngay bây giờ, cùng với các tính năng độc đáo, podcast, video và hơn thế nữa.
