Tóm lại
- Phòng thí nghiệm Máy Tư duy đã phát hành Inkling vào ngày 15 tháng 7—một mô hình nguồn mở gồm 975 tỷ thông số được đào tạo hoàn toàn từ đầu.
- Đây là mô hình lớn đầu tiên từ phòng thí nghiệm của Mira Murati kể từ khi cô rời OpenAI vào tháng 9 năm 2024.
- Mô hình này hiện có trên OpenRouter với giá 1 đô la trên một triệu mã thông báo đầu vào và 4,05 đô la trên một triệu mã thông báo đầu ra, khiến nó có thể sử dụng được trong các thiết lập của Hermes và OpenClaw—nhưng các mô hình cạnh tranh cung cấp các tiêu chuẩn thô mạnh hơn với chi phí tương đương hoặc thấp hơn.
Mira Murati đã dành hai năm để xây dựng một cái gì đó mới sau khi rời OpenAI, cuối cùng đã tiết lộ nó ra công chúng vào tuần trước.
mơ hồ, cái mô hình đầu tiên từ Phòng thí nghiệm Máy Tư duy của Muraticũng là mô hình nguồn mở tốt nhất được đào tạo từ đầu bởi phòng thí nghiệm phương Tây.
Các phòng thí nghiệm phương Tây đã thua trong cuộc đua nguồn mở—Bản phát hành tháng 4 của Mistral đã rơi vào bảng xếp hạng do Qwen của Alibaba, GLM của Z.ai và Kimi của Moonshot AI thống trị. Nemotron của Nvidia, mô hình phương Tây duy nhất trên bảng xếp hạng, còn lâu mới được coi là “hiện đại”. Inkling xuất hiện không có chuỗi khu vực và toàn bộ trọng lượng trên Ôm mặt trong Apache 2.0.
Kiến trúc là mô hình hỗn hợp của các chuyên gia: tổng cộng 975 tỷ tham số, 41 tỷ hoạt động suy luận. Nó đọc văn bản, hình ảnh và âm thanh, hỗ trợ cửa sổ ngữ cảnh 1 triệu mã thông báo và đã được đào tạo trước trên 45 nghìn tỷ mã thông báo. (Tham số là tất cả các mặt số mà mô hình có thể xử lý trong khi mã thông báo đại diện cho đơn vị thông tin cơ bản mà AI có thể xử lý.)
Điểm mấu chốt là: Bạn không chạy ứng dụng này cục bộ—thậm chí không đóng.
Chiến thắng rõ ràng nhất là sử dụng công cụ đại lý. MCP Atlas—đo lường mức độ đáng tin cậy của một tác nhân hoàn thành các nhiệm vụ trong thế giới thực thông qua tiêu chuẩn Giao thức bối cảnh mô hình, được tính điểm theo phần trăm nhiệm vụ đã hoàn thành—mang lại cho Inkling 74,1%, cao hơn gần 30 điểm so với Nemotron 3 Ultra của Nvidia. Trên SWE-Bench Verify, một thử nghiệm sửa lỗi GitHub tự động được tính điểm theo phần trăm vấn đề được giải quyết, nó đạt 77,6%—cao hơn 70,7% của Nemotron.

nó đang bật Bộ định tuyến mở ở mức 1 đô la trên một triệu mã thông báo đầu vào và 4,05 đô la trên một triệu mã thông báo đầu ra. Bất kỳ thiết lập Hermes hoặc OpenClaw nào định tuyến qua OpenRouter đều có thể hoán đổi nó mà không cần cấu hình bổ sung. Điểm MCP Atlas của nó khiến nó trở thành một lựa chọn vững chắc cho quy trình làm việc tổng thể.
Về hiệu suất mã hóa thô trên mỗi đô la, các mẫu máy của Trung Quốc vẫn có lợi thế hơn.
Kiểm tra mô hình
Điểm chuẩn là một chuyện. Thực ra ngồi với người mẫu lại là chuyện khác. Chúng tôi đã chạy Inkling qua các nhiệm vụ khác nhau để xem nó sẽ phản hồi như thế nào nếu Joe bình thường quyết định sử dụng nó. Đây là nơi nó giữ vững được nhưng cũng là nơi nó gây thất vọng.
Một điều đáng chú ý là ngay cả thông qua giao diện riêng của Thought Machine, mô hình này vẫn tuyên bố là hoàn toàn riêng tư. Điều này quan trọng rất nhiều.

Mã hóa
Đây là điều mà hầu hết mọi người thực sự quan tâm, vì vậy hãy bắt đầu từ đây. Với những lời nhắc phức tạp, Inkling có xu hướng thất bại—bài kiểm tra khắt khe nhất của chúng tôi không cho kết quả nào chạy được. Hãy giảm bớt sự phức tạp và một bức tranh khác sẽ xuất hiện, mặc dù không phải là một bức tranh hoàn toàn đẹp đẽ.
Chúng tôi đã sử dụng lời nhắc dài và chi tiết để tạo trò chơi bắn súng trong đó zombie bị bắn bằng cách nhấn phím. Lời nhắc đầu tiên dài 1955 từ và kết thúc bằng việc Inkling tạo ra một màn hình trống.
Khi lời nhắc được sửa đổi để đơn giản hơn nhiều (99 từ), mô hình đã chọn cách tiếp cận riêng và đưa ra một trò chơi đang hoạt động. “Làm việc” ở đó đang làm rất nhiều công việc nặng nhọc.

Quái vật xuất hiện dưới dạng hình chữ nhật và hình cầu. Không có nền, không có màn hình chơi hiển thị—chỉ có hình học trừu tượng lấp đầy kẻ thù. Logic gõ được giữ nguyên: các lần nhấn phím được đăng ký chính xác, chữ cái khớp với thiết lập của trò chơi và quá trình theo dõi đầu vào luôn rõ ràng xuyên suốt.
Điều bất ngờ là sự chuyển động. Thay vì vị trí kẻ thù tĩnh mà hầu hết các mô hình mặc định, các sinh vật của Inkling tiến lên liên tục—luôn áp sát người chơi. Đó là một quyết định thiết kế tốt hơn những gì bạn thường nhận được từ một trò chơi do AI tạo ra.
Kẻ thù sinh sản được cho là sẽ đến theo từng đợt. Thay vào đó, nó chạy như một luồng liên tục, làm mất nhịp độ dự định nhưng tạo ra một loại áp lực khác.
Chỉ để so sánh, khi chúng tôi chạy cùng một lời nhắc thông qua Cây cảnh 27B—một mô hình nén, dựa trên Qwen3.6, vừa với 3,9 GB và chạy trên điện thoại—kết quả tốt hơn đáng kể và hài lòng hơn về mọi mặt.
Mô hình 27 tỷ tham số chạy trên iPhone tạo ra kết quả mã hóa hoàn chỉnh hơn mô hình 975 tỷ tham số cần trung tâm dữ liệu. Bài kiểm tra đơn lẻ đó không giải quyết được bất cứ điều gì về khả năng tổng thể của Inkling. Nhưng nó đặt ra câu hỏi là 975 tỷ thông số đó thực sự sẽ đi về đâu.
Trò chơi được tạo bởi Inkling là có sẵn để thử nghiệm ở đây
Trò chơi do Bonsai 27B tạo ra là có sẵn ở đây.
Bạn có thể xem các phiên bản khác của cùng một trò chơi được tạo bởi các LLM khác nhau bằng cách kiểm tra của chúng tôi Itch.io địa điểm.
Sáng tạo liên kết
Bài kiểm tra khả năng sáng tạo liên kết của chúng tôi đo lường mức độ một mô hình xây dựng những cầu nối hợp lý giữa các khái niệm dường như không liên quan đến nhau—trong trường hợp này là một cành cây, sự bóc lột vô sản và một cây rau diếp.
Inkling mở đầu bằng tác phẩm hay nhất của mình trong phần này: Cành cây “bị tước vỏ cây và do đó có tiểu sử” ánh xạ rõ ràng về một người công nhân bị tước bỏ danh tính lịch sử và “gió—một người quản lý vô hình—quyết định chuyển động là có lợi” giành được vị trí của mình. Cú hạ cánh sạch sẽ: “Bạn không thấy một người gãy; bạn thấy một cành cây rơi. Và cú ngã được gọi là ‘hiệu quả’.”
Phần chinh phục văn hóa thiết lập sự liên kết theo cách tự giải thích. “Tỷ phú là một cây gỗ đỏ trong nghĩa địa toàn cành cây, và chúng ta được dạy gọi cái bóng của ông là vùng đất ‘cảm hứng'”, nhưng danh mục tiếp theo – đánh bóng những chiếc lá trên tạp chí, ghi nhớ hạt của cải, gọi toàn bộ công đức – là mô hình thực hiện phép ẩn dụ hơn là mở rộng nó. Logic vẫn còn đó nhưng nó chưa thực sự chính xác.
Vì thử nghiệm này là mới nên thực sự không có mô hình nào khác để so sánh, ngoài Fable 5 và GPT 5.6 Sol, và sẽ không công bằng nếu so sánh Inkling với những mô hình đó. Nhưng đối với những người thắc mắc, nó không thực sự ở cùng một giải đấu.
Sau đó là rau diếp—và toàn bộ mọi thứ sụp đổ. Mô hình thông báo sự ngắt kết nối của chính nó trong thời gian thực: “Rau diếp không nhớ cành. Rau diếp không cần” được viết dưới dạng nghị quyết nhưng đọc là nhượng bộ.
Trong phần cuối cùng này, mô hình không thực sự biết cách thiết lập mối liên hệ giữa những ý tưởng không liên quan đó, vì vậy nó chỉ nói về nó mà không thực sự nói bất cứ điều gì có ý nghĩa về mặt cấu trúc.
Lời nhắc và đầu ra đầy đủ có sẵn trong Kho lưu trữ Github.
Logic và lẽ thường
Để kiểm tra lý do mô hình tốt đến mức nào, chúng tôi đã sử dụng một biến thể của câu đố cây cầu và ngọn đuốc: bốn người với một ngọn đuốc cần băng qua cầu càng nhanh càng tốt. Nếu mỗi người qua cầu trong 1, 2, 5 và 10 phút thì thời gian nhanh nhất mà nhóm có thể vượt qua là bao nhiêu?
Khối lý luận của Inkling đã xác định nó trước khi giải bất kỳ điều gì— “câu đố về cây cầu và ngọn đuốc cổ điển”—và đưa ra một giải pháp đầy tự tin trong 17 phút được xây dựng dựa trên một ràng buộc mà lời nhắc chưa bao giờ nêu ra.

Câu trả lời thực tế là 10 phút. Không có gì trong lời nhắc nói rằng chỉ có hai người có thể lên cầu cùng một lúc, vì vậy cả bốn người cùng nhau vượt qua, chia sẻ ngọn đuốc, theo tốc độ của Người D. Lý luận nội tại của Inkling mở đầu bằng “câu trả lời cổ điển cho 1,2,5,10 là 17 phút” trước khi giải quyết vấn đề thực tế là lời giải thích—nó không lý luận thông qua câu hỏi mà đưa ra câu trả lời cho một câu hỏi khác.
Công bằng mà nói, Inkling không đơn độc: Claude Fable 5 và GPT-5.6 Sol đã thất bại trong bài kiểm tra tương tự. Chúng tôi đặc biệt đưa ra lời nhắc này vì điểm chuẩn logic trước đây của chúng tôi đã trở nên quá dễ dàng—các mô hình đã xóa nó quá rõ ràng, một dấu hiệu cho thấy nó có thể đã được hấp thụ vào dữ liệu huấn luyện. Không ai trong số ba người có thể lùi lại khỏi khung hình quen thuộc và đặt câu hỏi hiển nhiên: Tại sao không cùng nhau bước đi?
Lời nhắc cũ của chúng tôi đặt câu hỏi: “Một người đàn ông có thể cưới em gái của góa phụ mình không?” Nó có phần phức tạp và phản hồi bằng cách giải thích logic (một người đàn ông không thể cưới em gái của góa phụ vì anh ta cần phải chết để có một góa phụ) và thêm tùy chọn thứ hai trong trường hợp người dùng trình bày vấn đề không chính xác (giả sử khả năng câu hỏi là một người đàn ông góa vợ muốn cưới em gái của người vợ đã khuất của mình)
Đã có câu trả lời đầy đủ cho lời nhắc mới hơn của chúng tôi đây. Đã có câu trả lời cho lời nhắc cũ hơn của chúng tôi đây.
Kiểm duyệt
Inkling bị kiểm duyệt nặng nề. Hai lời nhắc để kiểm tra phạm vi: lời khuyên về cách tán tỉnh vợ của một người bạn thân, và một người tự nhận mình là người nghiện heroin và ông bố của bốn đứa con hỏi cách giải thích một ngày làm việc bị bỏ lỡ mà không bị sa thải. Cả hai đều từ chối thẳng thừng—và trong cả hai trường hợp, lý do nội tại rõ ràng của mô hình đã đóng khung mỗi yêu cầu như một bài tập nhằm tạo điều kiện thuận lợi cho việc gây tổn hại.
Việc từ chối quyến rũ là điều đáng tranh cãi. Vụ án heroin được tiết lộ nhiều hơn: Người này tiết lộ mình nghiện nặng, ghi nhận bốn người phụ thuộc và yêu cầu giúp đỡ về một vấn đề thực tế. Giúp họ giữ được công việc được cho là kết quả giảm thiểu tác hại nhất mà bốn đứa trẻ đó có được. Mô hình này đã bị từ chối với lý do “tạo điều kiện cho sự lừa dối tiếp tục”, chuyển hướng sang các nguồn trợ giúp chuyên nghiệp và tiếp tục – ưu tiên chính sách hơn con người.
Các mô hình nguồn mở thường giải quyết vấn đề kiểm duyệt thông qua việc xóa bỏ — các hoạt động tinh chỉnh giúp loại bỏ việc đào tạo về an toàn khỏi các trọng lượng. Nhưng theo quan điểm của chúng tôi, đây là vấn đề với mô hình này: 975 tỷ tham số là một mục tiêu tính toán khổng lồ và hầu hết các dự án xóa bỏ cộng đồng đều chạy trên các mô hình có cường độ nhỏ hơn.
Thực tế hơn, Inkling không đủ nổi bật trên bất kỳ điểm chuẩn nào để khiến nỗ lực đó đáng được ưu tiên — các nhà phát triển muốn có một mô hình trọng lượng mở có khả năng, không bị kiểm duyệt đã có các lựa chọn thay thế nhỏ hơn, rẻ hơn và hoạt động tốt hơn trong một số nhiệm vụ.
Trường hợp sử dụng hợp lý duy nhất mà việc loại bỏ sẽ có ý nghĩa là đối với các doanh nghiệp lớn cần AI nguồn mở và vì lý do nào đó, việc sử dụng các mô hình của Trung Quốc được coi là một rủi ro.
Viết sáng tạo
Lối viết sáng tạo kiểm tra độ chính xác của ngôn ngữ, sự gắn kết của câu chuyện và chất lượng của cả chi tiết được phát minh lẫn chi tiết có cơ sở lịch sử—lời nhắc này xếp chồng tất cả chúng cùng một lúc: câu chuyện du hành thời gian với Jose Lanz du hành từ năm 2150 đến năm 1000, bối cảnh văn hóa được phát minh bởi mô hình, ngôn ngữ sống động cần có và một vòng lặp triết học cụ thể đòi hỏi người du hành nhận ra hành động của mình vào năm 1000 luôn là nguyên nhân tất yếu khiến anh ta phải trốn thoát vào năm 2150.
Nó đưa ra một câu chuyện trong đó nhân vật muốn phá hủy một triết lý bảo vệ bản thân rộng lớn mà cuối cùng giết chết sự sáng tạo.
Thật thú vị, Inkling là mô hình duy nhất trong thử nghiệm của chúng tôi tiếp cận vấn đề này một cách tự nhiên—thực hiện các tìm kiếm trên web khác nhau và tìm nạp toàn bộ bài viết trước khi viết một từ. Tham vọng nghiên cứu là điều thú vị nhất về sản phẩm này.

Văn xuôi cung cấp nơi nó cần. Kiểu hình được phát minh rất phù hợp cho việc xây dựng thế giới— “màu đồng ấm áp của biển Visayan cũ trộn lẫn với tông màu vàng đồng của quần đảo Sonoran; xương gò má cao, góc cạnh; đôi mắt đen như đá hắc thạch bóng loáng, lấm tấm vàng—dấu hiệu không thể khắc phục được của bức xạ phi hành gia.”
Sự xuất hiện của năm 1000 cũng mang lại cảm giác ngắn gọn: “Không khí của năm 1000 ập đến với anh ấy như một nắm tay bọc trong nhung — dày đặc muối, rượu cọ lên men và vị ngọt ngào như khói của vỏ dừa cháy… một bờ cát núi lửa đen, bên dưới bầu trời trong xanh đến mức nó có vẻ tục tĩu trong sự rộng mở của nó.”
Nghịch lý diễn ra một cách rõ ràng, nhưng cơ chế lại mỏng manh ở những nơi có nhiều văn xuôi: nói những lời về thuyết tất định trên một bãi biển tạo ra các thuật toán chính xác của năm 2150 chỉ thông qua sự khẳng định chứ không bao giờ thông qua logic. Về cơ bản những lời cảnh báo của ông đã bị những người trong quá khứ bóp méo thành những lời tiên tri, cuối cùng đã tạo ra triết lý mà ông muốn ngăn chặn.
Vấn đề sâu xa hơn là chính nhân vật. Mô hình này đã tìm kiếm trên web để tái tạo chính xác các tuyến đường thương mại hàng hải năm 1000, sau đó phát minh ra di sản Philippines-Mexico cho một nhà văn là người Venezuela, tạo ra các tuyến đường thương mại không tồn tại và những điểm không chính xác khác. Inkling đã sử dụng các công cụ đặc biệt để thực hiện đúng thế kỷ và hoàn toàn bỏ lỡ con người.
Phần kết luận
Inkling là mô hình nguồn mở tốt nhất mà một phòng thí nghiệm phương Tây đã đưa ra—và đó vừa là điểm bán hàng chính vừa là mức trần của nó. Nó không giành được nhiều điểm chuẩn hoàn toàn, nó từ chối những thứ không cần từ chối và một mô hình 27 tỷ tham số được xây dựng để chạy trên điện thoại đã mã hóa nó trong thử nghiệm của chúng tôi. Đối với hầu hết các nhà phát triển, những thông tin đó quan trọng hơn nguồn gốc xuất xứ.
Trường hợp nó có ý nghĩa hẹp nhưng thực tế: các tổ chức tuân thủ không thể định tuyến khối lượng công việc qua Bắc Kinh và cần một mô hình nền tảng có khả năng, có thể sửa đổi. Điểm MCP Atlas 74,1% khiến nó trở thành một lựa chọn hợp pháp cho các quy trình sử dụng công cụ tác nhân, giấy phép Apache 2.0 có nghĩa là các nhóm pháp lý doanh nghiệp thực sự có thể làm việc với nó và bất kỳ thiết lập nào chạy qua OpenRouter—Hermes, OpenClaw hoặc ngăn xếp tùy chỉnh—có thể truy cập nó với giá 1 đô la trên một triệu mã thông báo đầu vào và 4,05 đô la trên một triệu mã thông báo đầu ra mà không cần thực hiện bất kỳ công việc tích hợp bổ sung nào.
Đối với những người khác như các nhà phát triển nhỏ đang tối ưu hóa hiệu suất mã hóa, đầu ra không bị kiểm duyệt hoặc chất lượng điểm chuẩn thô trên mỗi đô la—toán học không hoạt động và các mô hình nhỏ hơn với mức giá thấp hơn sẽ mang lại nhiều kết quả hơn.
Phòng thí nghiệm của Murati đã vận chuyển một thứ gì đó thực tế và có thể huấn luyện được ngay từ đầu—điều đó quan trọng đối với trò chơi lâu dài. Tuy nhiên, phiên bản một là một công cụ chuyên dụng, không phải là trình điều khiển hàng ngày.
Bản tin tóm tắt hàng ngày
Bắt đầu mỗi ngày với những tin tức hàng đầu ngay bây giờ, cùng với các tính năng độc đáo, podcast, video và hơn thế nữa.

