
Lần đầu tiên, OpenAI không cung cấp một mô hình có mặt số tư duy. GPT-5.6 có ba LLM thực sự riêng biệt—Sol, Terra và Luna—với chương trình đào tạo khác nhau, mức giá khác nhau và mức trần năng lực khác nhau. Sự so sánh quan trọng là Sol chống lại Truyện ngụ ngôn Claude 5Mô hình đại chúng có năng lực nhất của Anthropic hiện nay.
Sol có giá 5 USD cho mỗi triệu token đầu vào và 30 USD đầu ra. Fable 5 có giá 10 USD và 50 USD—đắt gấp đôi, hiện đang thua một số điểm chuẩn mà các nhà phát triển thực sự đã thực hiện. Luna, rẻ nhất trong ba loại với đầu vào 1 USD và đầu ra 6 USD, đã vượt xa Opus 4.8 của Anthropic về mã hóa. Chi tiết cuối cùng đó sẽ trở thành vấn đề thực sự vào ngày 19 tháng 7.
Fable 5 đã có một tháng khó khăn. Chính phủ Mỹ đã cấm nó vào ngày 12 tháng 6 sau khi các nhà nghiên cứu của Amazon tìm thấy một bản bẻ khóa biến mô hình này thành một máy quét lỗ hổng ngoài ý muốn. Anthropic đã kéo nó ra toàn cầu trong 19 ngày, xây dựng một bộ phân loại an toàn mới và đưa nó trở lại vào ngày 1 tháng 7 với một cửa sổ truy cập nén.
Kể từ khi quay trở lại, mô hình này đã chạy theo thời hạn vay mượn. Anthropic đã lên kế hoạch chuyển nó ra sau bức tường thanh toán tín dụng sử dụng vào ngày 7 tháng 7, sau đó được đẩy sang ngày 12 tháng 7, bây giờ là ngày 19 tháng 7. Mỗi phần mở rộng đều được thông báo vài giờ trước khi hết thời gian, không bao giờ thông qua một bài đăng chính thức.
Chúng tôi đang mở rộng quyền truy cập Claude Fable 5 trên tất cả các gói trả phí, cũng như giữ giới hạn tỷ lệ hàng tuần của Claude Code ở mức cao hơn 50% cho đến ngày 19 tháng 7.
– Claude (@claudeai) Ngày 12 tháng 7 năm 2026
Lý do không khó đọc. Nếu Fable ngừng đăng ký sau ngày 19 tháng 7, mô hình tốt nhất dành cho người đăng ký trả phí của Anthropic sẽ trở thành Opus 4.8—mà Luna đã đánh bại về mã hóa với mức giá chỉ bằng một phần nhỏ. Giữ Fable có sẵn, thậm chí ở mức 50% giới hạn hàng tuần, là điều duy nhất giữ cho cấp đăng ký của Anthropic trông tệ hơn so với tầm trung của OpenAI trên giấy tờ.
Mặt đối mặt về điểm chuẩn, sự cạnh tranh rất chặt chẽ. Về Chỉ số tác nhân mã hóa phân tích nhân tạo, Sol đạt 80 điểm so với 77,2 của Fable — sử dụng khoảng một nửa số mã thông báo, trong thời gian chưa đến một nửa, với chi phí khoảng một phần ba. Trong Bài kiểm tra cuối cùng của Đại lý, nơi thực hiện các quy trình làm việc chuyên nghiệp trên 55 lĩnh vực, Sol đạt 53,6% so với 40,5% của Fable. Trong Terminal-Bench 2.1, Sol ở chế độ cực cao (song song bốn tác nhân phụ) đạt 91,9% so với 83,1% của Fable.
Trên Chỉ số thông minh rộng hơn, tổng hợp 9 điểm chuẩn khác nhau, Fable 5 đánh bại GPT 5.6 chỉ bằng một điểm duy nhất, điều đó có nghĩa là khoảng cách về năng lực hầu như không đáng chú ý.

Kiểm tra các mô hình
Điểm chuẩn và bài kiểm tra đã tập trung quá nhiều vào khả năng mã hóa để đo lường khả năng của một mô hình. Nhưng chúng tôi không phải là tin tặc, vì vậy, ngoài một trò chơi mã hóa cảm giác đơn giản, chúng tôi đã sử dụng các lời nhắc khác một chút so với kịch bản mã hóa thông thường. Đây là những gì thực sự đã xảy ra.
Viết sáng tạo
Chúng tôi đã chạy cùng một lời nhắc (có sẵn trong Github của chúng tôi) thông qua cả hai mô hình: Đưa Jose Lanz quay trở lại từ năm 2150 đến năm 1000, buộc anh ta vào một nghịch lý du hành thời gian và không để anh ta hiểu mình đã làm gì cho đến khi về nhà.
Cả hai người mẫu đều hướng đến một thứ gì đó gần giống một cuốn tiểu thuyết hơn là một truyện ngắn. Cả hai cũng phá vỡ một quy tắc quan trọng: Hãy chú ý đến nghịch lý khi anh ta quay trở lại tương lai.
GPT-5.6 Sol nhờ Jose tìm ra ở giữa câu chuyện rằng “người du hành vô danh không phải là người mà anh ta đến để ngăn chặn. Chính là anh ta.” Truyện ngụ ngôn thậm chí còn trực tiếp hơn về điều đó, với việc Jose trước đây nhận ra rằng toàn bộ nghịch lý xảy ra là do anh ta. “Không có sự kiện hạt giống. Anh ấy là sự kiện hạt giống.”
Mục nhập của GPT-5.6 Sol, “Ngọn lửa đầu tiên,” thuộc thể loại khoa học viễn tưởng đơn giản—Jose vô tình giới thiệu cái lò gây ra sự sụp đổ khí hậu mà anh ấy quay lại để ngăn chặn. Phần mở đầu thực sự hay: “Chỉ có sấm sét. Chỉ có côn trùng. Chỉ có hơi thở ẩm ướt của thế giới trước máy móc.”

Tuy nhiên, vấn đề là Sol không tin tưởng vào hình ảnh đó để thực hiện công việc của mình. Nó giải thích vòng lặp, rồi giải thích lại, sau đó có một phiên bản cũ hơn của Jose để lại đoạn ghi âm giải thích lần thứ ba: “Nỗ lực giải quyết vấn đề của anh ấy đã tạo ra vấn đề. Nỗ lực giảm thiểu tác hại của anh ấy đã tạo ra giải pháp.” Rõ ràng là vậy, nhưng đến vòng thứ ba thì cũng mệt mỏi.
Truyện ngụ ngôn Claude 5″Lo Que Arde, Vuelve” xây dựng nghịch lý tương tự từ Hồ Maracaibo, tia chớp Catatumbo và ngôi làng Añu—Jose vô tình tạo ra lời tiên tri mà ông quay trở lại để xóa bỏ, chỉ bằng cách an ủi một đứa trẻ đang sợ hãi. Toàn bộ vòng lặp chỉ gói gọn trong một dòng: “Nỗi đau buồn khiến anh ta lùi bước là hàng hóa anh ta đã giao.”
Vấn đề của Fable là hình ảnh phản chiếu của Sol – nó hơi quá tin tưởng vào văn xuôi của chính mình, xếp chồng các ẩn dụ cho đến khi một dòng như “Bạn không thể kéo sợi chỉ, bạn là sợi chỉ” đọc giống như người mẫu đang ngưỡng mộ chính nó hơn là câu chuyện cần nó.

Tuy nhiên, trong thử nghiệm chủ quan của chúng tôi, “Lo Que Arde, Vuelve” của Fable nhìn chung là một câu chuyện hay hơn “The First Fire” của GPT. Fable lấy nó dựa trên đặc điểm văn hóa, một vòng lặp nhân quả rõ ràng hơn và một cái kết được giải quyết thông qua hành động thay vì độc thoại. Sol coi nó ở dạng dễ đọc—đây là phiên bản bạn trao cho người muốn cơ chế được giải thích rõ ràng chứ không phải ngụ ý. Cả hai câu chuyện, xét theo giá trị của nó, đều hay, chỉ là không hay.
Sự nhảy vọt về chất lượng so với thế hệ trước của họ không thực sự đáng chú ý.
Tư duy liên kết: Một cành cây, một cuộc tranh luận giai cấp, một cây rau diếp
Bài kiểm tra thứ hai đo lường tư duy liên kết, không phải chính trị. các nhắc nhở: Miêu tả một cành cây, dùng miêu tả đó để giải thích sự bóc lột công nhân và sự tôn thờ mù quáng của người giàu, sau đó để câu chuyện chuyển thành mô tả về cây rau diếp. Ý tưởng là để đánh giá xem liệu phép ẩn dụ có thể mang lại lập luận mà không cần mô hình bước ra ngoài để giải thích những gì nó đang làm hay không.
GPT-5.6 Sol mở mạnhgiải thích cách cành cây tạo ra thân cây và duy trì cây, trước khi hướng nó đến những người công nhân “xây những ngôi nhà mà họ có thể không bao giờ mua được” và “sản xuất những hàng hóa mà họ khó có thể mua được.” Câu “người công nhân không chỉ từ bỏ sức lao động mà còn cả trí tưởng tượng” là một trong những câu sắc nét hơn. Nhưng Sol vẫn tiếp tục phá bỏ ảo tưởng của chính mình để kể lại— “phần lớn giai cấp vô sản hiện đại bị đối xử theo cách tương tự” công bố phép ẩn dụ thay vì tin vào nó. Đoạn kết rau diếp chưa thực sự ăn nhập với toàn bộ câu chuyện nên sự liên kết chưa phải là hay nhất.
Truyện ngụ ngôn Claude 5 chôn vùi lý lẽ hoàn toàn bên trong đối tượng thay vì thuật lại nó. Cành của nó “chuyển nước mà nó không bao giờ uống” và “giữ những chiếc lá mà nó không bao giờ sở hữu”, cho phép sự khai thác lộ diện thông qua mô tả vật lý mà không có biển chỉ dẫn kèm theo. Động thái sắc bén hơn là biến những cành cây đổ thành những người tin tưởng, mỗi người đều thuyết phục rằng đó là một “nhánh giai đoạn đầu” đang trải qua “một bước thụt lùi tạm thời”, chắc chắn rằng nó sẽ vươn tới tán cây “với sự hối hả và hydrat hóa” —một cơ hội rõ ràng để theo đuổi sự giàu có không bao giờ đến.

Nó vượt quá nhiều điểm— “chín mươi lăm phần trăm nước và một trăm phần trăm không ấn tượng” – và phần kết giữ cho ẩn dụ hiển thị thay vì để nó tan biến, mô tả loại rau này “không có thân, không có tán, không có giấc mơ hướng lên” thay vì chỉ là một cây rau diếp.
Nhìn chung, có tỷ số hòa và điểm số tùy thuộc vào sở thích. Nếu bạn cần giải thích mọi thứ thì GPT 5.6 Sol là phiên bản tốt nhất. Nếu muốn người đọc tự mình khám phá thông điệp thì Claude Fable 5 sẽ thắng.
Lý luận logic và phi toán học: Câu đố về cây cầu, viết lại
Chúng tôi bắt đầu sử dụng một lời nhắc mới bởi vì các mô hình bắt đầu trả lời một cách nhất quán câu trả lời trước đó của chúng tôi—một dấu hiệu cho thấy nó tồn tại ở đâu đó trong dữ liệu đào tạo của họ thay vì được lý luận thông qua trực tiếp. Đọc theo nghĩa đen, bốn người cùng một ngọn đuốc cần đi qua một cây cầu. Tất cả đều có tốc độ đi bộ khác nhau, “A” nhanh nhất sau 1 phút và “D” chậm nhất sau 10 phút. Hỏi nhóm đó sẽ đi qua cầu trong bao lâu?
GPT-5.6 Sol đã trả lời 17 phút mà không thể hiện kết quả của mình, thực hiện xáo trộn năm bước giống như câu đố ban đầu—A và B chéo, A trả lại, C và D chéo, B trả lại, A và B chéo lại. Không có gì trong câu trả lời của nó đăng ký rằng lời nhắc không bao giờ giới hạn số lượng người có thể ở trên cầu cùng một lúc. Nó không giống một vấn đề đã được giải quyết mà giống một vấn đề được lưu trong bộ nhớ đệm hơn.

Truyện ngụ ngôn Claude 5 hạ cánh sai cùng một con số, kéo dài 17 phút, nhưng đã tranh luận rất lâu, giải thích rằng “sẽ hiệu quả hơn nếu cử hai người chậm nhất đi cùng nhau” và định lượng chi phí của cách tiếp cận ngây thơ như một “thuế hộ tống”: A sẽ trả riêng phí vận chuyển C và D. Lý do này dễ đọc hơn lý do của Sol và cũng giống như vấn đề chính—cả hai mô hình đều không kiểm tra xem ràng buộc mà nó đang giải quyết có thực sự nằm trong gợi ý mà chúng tôi đã viết hay không.

Nếu bạn tò mò, câu trả lời đúng là 10 phút nếu tất cả cùng vượt qua và đi theo tốc độ của người chậm nhất.
Mã hóa: Trò chơi trình duyệt một lần
Thử nghiệm cuối cùng là bản dựng một lần bắn: đưa cho mỗi mô hình một lời nhắc cho một trò chơi bắn súng dựa trên cách đánh máy, trong đó các lần bắn được điều khiển bởi người dùng gõ từ và lấy bất cứ thứ gì xuất hiện mà không cần theo dõi, không lặp lại, không có cơ hội thứ hai.
GPT-5.6 Sol dường như đã thay đổi tùy chọn giao diện người dùng và hiện thích các thành phần giao diện người dùng phẳng, vuông hơn, gần với Windows 8.1 hơn là độ dốc đường chéo từ tím sang xanh bóng loáng mà mọi trình tạo hình ảnh AI dường như mặc định sử dụng. Nó cũng là mẫu duy nhất biến vũ khí này thành một máy đánh chữ bắn đạn thay vì một khẩu súng thực sự, một cách gọi thực sự khác.

Tuy nhiên, hình nền vẫn phẳng và khô trong mọi thiết lập được tạo, tâm nhắm mục tiêu tĩnh thay vì theo dõi kẻ thù và hình học—kẻ thù, vết máu khi tiêu diệt—trông giống với động cơ cuối những năm 90 hơn bất kỳ thứ gì hiện tại. Đó là một bước tiến rõ ràng so với GPT-5.5 và sáng tạo hơn Opus, nhưng không đủ để đánh bại Fable 5 chỉ trong một phát bắn.
Truyện ngụ ngôn Claude 5 đã giành chiến thắng với tỷ số cách biệt lớn trong bài kiểm tra mã hóa cảm xúc của chúng tôi. Nó vận chuyển âm nhạc, bầu không khí và hiệu ứng âm thanh mà bản dựng Sol đã bỏ qua hoàn toàn và kẻ thù của nó sử dụng phong cách cổ điển hình học tương tự nhưng được xây dựng cẩn thận hơn, gần giống với Minecraft hơn là xẻng cuối những năm 90.

Giao diện người dùng của nó sáng tạo và hấp dẫn hơn, với hoạt ảnh thực tế thay vì trạng thái tĩnh và nó theo dõi các từ mỗi phút—một chi tiết thực sự phản ánh mục tiêu đã nêu của lời nhắc là sử dụng trò chơi để luyện tốc độ gõ. Nó cũng có khả năng tăng sức mạnh, điều mà bản dựng của Sol không có.
Điểm chuẩn và các lập trình viên chuyên nghiệp không đồng ý với chúng tôi, nhưng trong thử nghiệm của chúng tôi, với cùng một lời nhắc, sự khác biệt giữa truyện ngụ ngôn Và Sol đáng chú ý là có lợi cho Fable.
Phần kết luận
Ngoài việc viết mã, bạn đừng mong đợi sẽ ngạc nhiên trước những mô hình mới này. Điều đó nói lên rằng, Fable 5 có vẻ như là mô hình mạnh mẽ nhất cho nhiều mục đích khác nhau, nhưng mô hình nào “tốt hơn” phụ thuộc hoàn toàn vào thứ nào trong bốn thứ bạn đang trả tiền.
Đối với người không sống trong cửa sổ đầu cuối—ai đó soạn email, đặt câu hỏi, sử dụng chatbot theo cách mà hầu hết mọi người thực sự sử dụng—các bài kiểm tra của chúng tôi chỉ hướng đến Fable về chất lượng, nhưng câu trả lời đó trở nên phức tạp bởi một điều gì đó không liên quan gì đến trí thông minh.
Tuy nhiên, khoảng cách về giá có thể là một yếu tố phá vỡ thỏa thuận. GPT-5.6 Sol, Terra và Luna hoàn toàn được bao gồm trong các gói trả phí của ChatGPT mà không kèm theo thời hạn sử dụng. Claude Fable 5 đang chạy trong lần gia hạn thời hạn thứ ba sau ba tuần và hoàn nguyên về khoản tín dụng sử dụng $10/$50 vào ngày 19 tháng 7 nếu Anthropic không dời ngày trở lại.
Nếu điều đó xảy ra, việc trả tiền cho mỗi token có thể không còn thú vị nữa.
Bản tin tóm tắt hàng ngày
Bắt đầu mỗi ngày với những tin tức hàng đầu ngay bây giờ, cùng với các tính năng độc đáo, podcast, video và hơn thế nữa.
