
Tóm lại
- Moonshot AI đã phát hành Kimi K3 vào ngày 16 tháng 7—một mô hình trọng lượng mở có 2,8 nghìn tỷ tham số, đánh bại các phòng thí nghiệm của Hoa Kỳ về các tiêu chuẩn chuyên biệt cụ thể.
- K3 có giá giống hệt với Claude Sonnet 5 (3 đô la trên một triệu mã thông báo đầu vào, 15 đô la trên một triệu mã thông báo đầu ra) trong khi đạt điểm gần hơn với Fable 5.
- Trọng lượng mô hình đầy đủ—các tệp cho phép mọi người chạy, tinh chỉnh hoặc xây dựng trên mô hình cục bộ—giảm xuống vào ngày 27 tháng 7 theo giấy phép MIT đã sửa đổi, biến K3 trở thành mô hình AI có sẵn miễn phí lớn nhất trong lịch sử.
Moonshot AI vừa đưa ra mô hình nguồn mở lớn nhất của Trung Quốc từng được phát hành và nó đứng đầu Claude Fable 5 về khả năng viết kịch bản.
Hướng tới Elo viết của AI—một tiêu chuẩn trong đó các người mẫu viết kịch bản thực được đánh giá mù quáng so với các phiên bản đã xuất bản, tính điểm bằng cách sử dụng cùng một hệ thống Elo để xếp hạng người chơi cờ—đặt Kimi K3 ở mức 2.840, trên Fable 5 (tối đa) là 2.760. Đó là thứ hạng mà đội Anthropic đã thống trị trong lịch sử.
Tin tức lớn từ tiêu chuẩn viết bài nội bộ của chúng tôi (kết quả ban đầu): Kimi K3 của @Kimi_Moonshot hiện là số 1 về viết bài bằng giọng xã luận của chúng tôi, ở mức 2840 Elo, vượt qua Claude Fable 5.
Đó là một bước nhảy vọt từ #21 lên #1 so với người tiền nhiệm của nó, Kimi K2.6. Và nó có giá khoảng 0,25 USD cho mỗi tập lệnh: 5x… https://t.co/000EosInEc pic.twitter.com/V18t7g4pHu
– Louis-François Bouchard 🎥🤖 (@Whats_AI) Ngày 16 tháng 7 năm 2026
K3 cũng giành được vị trí hàng đầu trên Bảng xếp hạng mã giao diện người dùng của Arena AI—một bảng xếp hạng được xây dựng từ hàng nghìn phiếu bầu theo cặp của con người trong các nhiệm vụ tạo mã, một lần nữa được Elo chấm điểm—với 1.679 so với 1.631 của Fable 5. Vị trí đầu tiên ở sáu trên bảy miền giao diện người dùng.
các Chỉ số trí tuệ phân tích nhân tạo—một điểm được xây dựng từ chín đánh giá độc lập bao gồm mã hóa, lý luận, công việc tác nhân và kiến thức, được xếp hạng từ 0 đến 100—đặt K3 ở mức 57, với Claude Fable 5 ở 60, GPT-5.6 Sol ở 59 và Claude Opus 4,8 ở 56. Điều đó đặt K3 là mô hình có khả năng cao thứ ba trên bảng tổng hợp, với Fable 5 chỉ đánh bại nó 3%.
Kimi K3 đang đánh bại Fable 5 trên BridgeBench.
Nhiệm vụ tương tự, ban giám khảo mù.
K3 đã thắng 7/8 đấu trường, trong đó có Refactoring 9-0 và Debugging 6-1.
Chiến thắng duy nhất của Fable 5: Tốc độ.
Fable 5 đã thắng 142-36 trước GPT 5.6 Sol và hiện đang thua 2-1 trước một mô hình nguồn mở… pic.twitter.com/CaRSjbIwUW
– Bàn cầu (@bridgebench) Ngày 17 tháng 7 năm 2026
Kimi K3 là người mẫu trình diễn xuất sắc nhất https://t.co/SnZ54Xok7ntrước Fable, đạt tỷ lệ thành công tương đương trong thời gian ngắn hơn.
Đây là lần đầu tiên một mô hình mở vượt lên trên tất cả các mô hình độc quyền về tiêu chuẩn kỹ thuật web toàn diện này.
Ghi chú:
▪️ Điểm chuẩn… pic.twitter.com/2MqvbAxAaw
– Guillermo Rauch (@rauchg) Ngày 16 tháng 7 năm 2026
Nếu bạn muốn biết nó có thể làm gì thì đây là kết quả không trúng đích về lời nhắc yêu cầu mô hình xây dựng bản sao iOS. Để so sánh, cái này là giá trị gần đúng tốt nhất được chia sẻ trên mạng xã hội bằng cách sử dụng GPT 5.6 Sol và một lời nhắc rất phức tạp.
Thứ này thực chất là gì
K3 chứa 2,8 nghìn tỷ tham số—các giá trị số lưu trữ kiến thức của mô hình—trong kiến trúc hỗn hợp các chuyên gia. Sự kết hợp của các chuyên gia chia các tham số đó thành 896 mạng con “chuyên gia” và chỉ kích hoạt một phần nhỏ cho bất kỳ nhiệm vụ nhất định nào. Đó là cách bạn có được thông tin ở cấp độ biên giới mà không làm tan chảy phòng máy chủ.
“Đây là mô hình nguồn mở đầu tiên trên thế giới thuộc loại 3 nghìn tỷ tham số, được thiết kế cho các tình huống tình báo biên giới bao gồm mã hóa trong thời gian dài, công việc tri thức và lý luận,” Moonshot AI nói. Đó không phải là sân khấu tiếp thị: V4-Pro của DeepSeek đứng đầu với 1,6 nghìn tỷ thông số, K2 của Moonshot là một nghìn tỷ. K3 gần gấp đôi đối thủ cạnh tranh hạng cân mở gần nhất trên biểu đồ kích thước.

Nó đi kèm với một cửa sổ ngữ cảnh gồm một triệu mã thông báo—mã thông báo là đơn vị thông tin cơ bản mà AI xử lý, mỗi mã chiếm khoảng 3/4 từ—sự hiểu biết về hình ảnh và video gốc cũng như lý luận luôn sẵn sàng.
Hai kỹ thuật kiến trúc làm nền tảng cho việc đạt được hiệu quả. Kimi Delta Chú ý tăng tốc độ giải mã cho các chuỗi dài—nhanh hơn tới 6,3 lần ở bối cảnh triệu mã thông báo. Chú ý Phần dư định tuyến thông tin có chọn lọc trên các lớp mô hình thay vì tích lũy thông tin một cách thống nhất, tăng thêm khoảng 25% hiệu quả đào tạo với chi phí tính toán tăng thêm dưới 2% — cùng nhau mang lại hiệu quả mở rộng tốt hơn khoảng 2,5 lần so với K2.
Benchmark đã đẹp, giá cũng đẹp hơn
Kimi K3 có giá 3 USD trên một triệu token đầu vào và 15 USD trên một triệu token đầu ra—cùng mức giá với Claude Sonnet 5, mô hình tầm trung của Anthropic. Sự khác biệt là Sonnet 5 là sản phẩm tầm trung của Anthropic; K3 kém Fable 5 3 điểm trên bảng tổng hợp Phân tích nhân tạo. Mỗi tác vụ trên bộ chín điểm chuẩn đó, K3 có giá 0,94 USD so với 1,04 USD cho GPT-5,6 Sol và 1,80 USD cho Opus 4,8.
Nói cách khác, mô hình này cung cấp hiệu suất hàng đầu ở mức giá trung bình.
BẰNG Giải mã được bảo hiểm vào tháng 5khoảng cách về giá giữa AI biên giới của Trung Quốc và Mỹ đã tăng lên 15–30 lần vào đầu năm nay. K3 không giảm giá ở mức DeepSeek—nó có giá giống như một mẫu máy tầm trung của phương Tây—nhưng mang lại hiệu suất gần như vượt trội ở mức đó. Đối với các nhóm xây dựng trên API, điều này thể hiện sự cải thiện đáng kể về chi phí.
Nếu Anthropic tiếp tục ý định cung cấp Fable 5 chỉ thông qua API, K3 sẽ trở thành giải pháp thay thế trọng lượng mở gần nhất cho bất kỳ mô hình nào hiện đang đứng thứ hai trong ngành—với chi phí bằng một nửa chi phí cho mỗi nhiệm vụ của Opus 4.8. Đó là kịch bản mà những người theo đuổi điểm chuẩn đang thực hiện phép toán.
Sự ra mắt của K3 là lý lẽ mà những người ủng hộ việc kiểm soát xuất khẩu chip của Hoa Kỳ không muốn có. Mỹ hạn chế xuất khẩu GPU H800 của Nvidia sang Trung Quốc vào cuối năm 2023; Moonshot xác nhận họ đã đào tạo các mô hình trước đó về những con chip đó. Tài liệu điểm chuẩn riêng của K3 đề cập đến H200 và cái mà công ty gọi là “GPGPU từ một nhà cung cấp thay thế” —được hiểu rộng rãi là phần cứng Huawei Ascend — mà không chỉ rõ phần cứng đó nằm ở đâu.
Chủ tịch Moonshot AI Yutong Zhang đã trực tiếp đưa ra các hạn chế tại Davos năm nay. Cộng hòa Silicon: “Chúng tôi biết mình không có đủ khả năng để mở rộng quy mô điện toán… Điều đó buộc chúng tôi phải tập trung vào nghiên cứu cơ bản và tính hiệu quả.” Các nhà phân tích của Bank of America, trong một ghi chú sau khi ra mắt, đã viết rằng K3 chứng minh “mở rộng quy mô trước đào tạo, kết hợp với đổi mới kiến trúc, vẫn có thể mang lại lợi ích thay đổi từng bước cho các mẫu hàng đầu của Trung Quốc” trong những hạn chế đó.
Moonshot là một trong những cái gọi là Công ty khởi nghiệp AI Tiger đã cùng nhau thay đổi bối cảnh mô hình toàn cầu mà không có quyền truy cập vào các con chip mà Washington cho biết họ cần. Cho dù đó là lập luận về việc kiểm soát xuất khẩu chặt chẽ hơn hay lập luận rằng chúng không có tác dụng thì đây vẫn là một câu hỏi chính sách mà Washington chưa giải quyết được.
Dấu hoa thị bạn nên đọc
Tỷ lệ ảo giác của K3 trên AA-Omniscience—một điểm chuẩn đo lường tần suất một mô hình tự tin tạo ra một câu trả lời mà nó không biết—đã tăng từ 39% lên 51% so với phiên bản tiền nhiệm K2.6. Nhiều câu trả lời đúng hơn về tổng thể; nhiều thứ trang điểm nữa. Mô hình này cũng thừa nhận trong tài liệu riêng của mình rằng nó có thể “chủ động quá mức”, đưa ra những quyết định bất ngờ thay mặt người dùng trong các nhiệm vụ tự trị kéo dài.
Đối với các đội đã chạy Công cụ dựa trên Kimi K2.6 và muốn nâng cấp, K3 là một bước tiến có ý nghĩa trên hầu hết các mặt trận — nhưng đồng bằng ảo giác đó đáng để kiểm tra căng thẳng trước khi bạn tin tưởng nó với bất kỳ điều gì cần chính xác.
Nếu bạn muốn dùng thử miễn phí, bạn có thể. Nó có sẵn trên trang web chính thức của Kimi. Nhưng chúc may mắn: Các máy chủ quá chật chội nên các tác vụ liên tục bị gián đoạn do hạn chế về lưu lượng truy cập, khiến nó hầu như không thể sử dụng được. Một giải pháp thay thế tốt hơn là trả tiền đăng ký hoặc sử dụng nó qua API.

Các quả cân sẽ được phát hành vào ngày 27/7. Các quả cân sẽ có sẵn cho các doanh nghiệp, doanh nghiệp lớn. Hiện tại không có GPU nội địa nào, dù lớn đến đâu, có thể xử lý được model có kích thước này.
Bản tin tóm tắt hàng ngày
Bắt đầu mỗi ngày với những tin tức hàng đầu ngay bây giờ, cùng với các tính năng độc đáo, podcast, video và hơn thế nữa.

