Tôi nhớ năm 2021, khi NFT ArtBlocks làm mưa làm gió, tôi đã ôm khư khư token vì tin vào "ý nghĩa" của nó. Kết cục: mất 112.000 USD. Bài học: đừng để cảm xúc lấn át phân tích. Hôm nay, khi Mira Murati – cựu CTO của OpenAI – công bố mô hình Inkling với tuyên bố "best Western open-source model", tôi lại thấy một mùi quen thuộc.
Sóng vỗ, ai đứng vững?
Bối cảnh: Một tuyên bố lớn, một mớ bí ẩn
Ngày 15 tháng 3 năm 2025, Thinking Machines Lab – startup do Mira Murati thành lập sau khi rời OpenAI – chính thức giới thiệu mô hình ngôn ngữ lớn đầu tiên mang tên Inkling. Thông báo xuất hiện trên nhiều kênh blockchain và Web3, không phải trên các tạp chí AI chuyên ngành. Điều này đã đặt ra dấu hỏi đầu tiên: tại sao một công ty AI lại chọn kênh crypto để PR?
Thông tin kỹ thuật là một mớ bí ẩn. Bài báo chỉ đề cập đến một chỉ số duy nhất: MCP (Model Context Protocol) score ấn tượng. MCP là giao thức cho phép mô hình tương tác với các công cụ bên ngoài, được phát triển bởi Anthropic. Nói cách khác, Inkling không được đánh giá trên các benchmark chuẩn như MMLU, HumanEval hay GSM8K, mà chỉ trên một metric đặc thù về khả năng Agent.
Cộng đồng AI lập tức chia làm hai phe: một bên tung hô đây là "bước đột phá cho AI Agent", bên còn lại nghi ngờ đây chỉ là một chiến dịch marketing được dàn dựng kỹ lưỡng. Điều đáng nói: không ai có quyền truy cập vào model để kiểm chứng. Model được đưa lên OpenRouter – nền tảng API aggregation – nhưng chưa có code, chưa có weight, chưa có báo cáo kỹ thuật.
Phân tích kỹ thuật: MCP score là đủ hay là "vàng mười" hay "vàng mã"?
Hãy cùng mổ xẻ tuyên bố "best Western open-source model". Để một mô hình được gọi là "best", nó cần vượt trội ở nhiều tác vụ. Nhưng ở đây, Inkling chỉ có một điểm sáng duy nhất: MCP score.

MCP là gì? Về bản chất, MCP là một giao thức cho phép LLM gọi hàm, truy xuất dữ liệu từ các nguồn bên ngoài, và thực thi các hành động phức tạp. Đây là nền tảng của kiến trúc Agent – thứ mà cả OpenAI, Anthropic và Google đang đua nhau phát triển. Tuy nhiên, MCP score không đo lường khả năng suy luận hay kiến thức tổng quát, mà chỉ đo khả năng tuân thủ protocol và hoàn thành task trong môi trường sandbox.
Vấn đề thứ nhất: Thiếu benchmark chuẩn. Một mô hình có điểm MCP cao nhưng thất bại ở MMLU hay HumanEval thì chẳng có giá trị gì ngoài việc làm môi giới tool calling. Cộng đồng open-source đã có những mô hình Agent mạnh như Qwen2.5-72B-Instruct (của Alibaba) hay DeepSeek-V3, nhưng chưa ai dám tự xưng là "best" chỉ dựa trên một metric.
Vấn đề thứ hai: Nguồn gốc mô hình không rõ ràng. Inkling được xây dựng từ đâu? Là fine-tune từ Llama, Mistral, hay từ zero? Nếu là fine-tune, việc tối ưu MCP score có thể chỉ là thêm một lớp adapter thông minh, chứ không phải một kiến trúc mới. Nếu là từ zero, 2 năm âm thầm phát triển là khoảng thời gian quá ngắn để tạo ra một mô hình cạnh tranh với DeepSeek-V3 (được đào tạo trên 2.8 triệu GPU giờ). Tôi nghiêng về giả thuyết: đây là fine-tune từ một base model có sẵn.
Vấn đề thứ ba: "Open-source" nhưng không mở. Định nghĩa "open-source" trong AI rất lỏng lẻo. Có thể là Apache 2.0 (thực sự mở), có thể là custom license (chỉ cho phép sử dụng phi thương mại). Chưa có thông tin về license của Inkling. Nếu họ giữ bí mật weight, thì "open-source" chỉ là một từ ngữ rỗng.

Vấn đề thứ tư: Tính so sánh. "Best Western open-source model" – so với ai? So với Llama 3.1 405B? Hay so với Mistral Large? Hay chỉ so với các mô hình nhỏ hơn? Câu nói này mơ hồ đến mức vô dụng. Nó giống như một quỹ DeFi khoe "APY cao nhất thị trường" mà không nói rõ rủi ro.
Góc nhìn phản trực giác: Đây có thể là một chiến dịch PR tinh vi
Sóng vỗ, ai đứng vững?
Tôi từng chứng kiến nhiều dự án crypto "bom tấn" chỉ dựa trên một con số đẹp. Năm 2020, một dự án Lending pool hứa APY 1000% – và hóa ra đó là pool của token rác. Năm 2022, một dự án Layer2 tuyên bố TPS vượt Visa – nhưng thực tế là chạy trên testnet 3 node. Inkling có mùi giống vậy.
Hãy nhìn vào chiến thuật: Mira Murati biết rằng cộng đồng open-source AI đang khao khát một "người hùng phương Tây" để đối đầu với DeepSeek (Trung Quốc) và Qwen (Trung Quốc). Bà tung ra một model với một chỉ số vượt trội, nhưng cố tình không công bố các benchmark khác. Điều này tạo ra hiệu ứng "halo": người đọc chỉ nhớ "best Western open-source" mà quên mất rằng không có đủ dữ liệu để so sánh.
Thêm vào đó, việc chọn OpenRouter làm nền tảng phát hành cũng rất thông minh. OpenRouter là nơi các developer thử nghiệm model mới. Nếu model thực sự tốt, họ sẽ lan truyền. Nếu không, thì cũng không ai nhớ. Đây là chiến thuật "thả thính" – đánh vào tâm lý FOMO, tạo ra sự tò mò rồi sau đó mới từ từ tiết lộ thông tin.
Điều trớ trêu: nếu Inkling thực sự mạnh, tại sao họ không tham gia ngay vào các leaderboard như LMSYS Chatbot Arena? Tại sao không công bố score trên GAIA (Agent benchmark)? Tại sao không mời báo chí AI uy tín viết bài, mà lại chọn kênh blockchain? Câu trả lời có thể là: họ không tự tin vào chất lượng tổng thể của model, chỉ tự tin vào một khía cạnh hẹp.
Tác động đến thị trường AI và blockchain
Nếu Inkling thực sự là một bước đột phá về Agent, nó sẽ tác động lớn đến lĩnh vực AI x Crypto. Các ứng dụng DeFi thông minh – như bot giao dịch tự động, Smart Contract Auditor AI – sẽ được hưởng lợi trực tiếp. Một model có khả năng gọi hàm và tương tác với hợp đồng thông minh một cách đáng tin cậy có thể mở ra kỷ nguyên "Agentic DeFi".
Nhưng nếu chỉ là PR, nó sẽ gây tổn hại đến niềm tin vào các dự án AI mới. Cộng đồng crypto vốn đã chai lỳ với các "pump and dump", nhưng cộng đồng open-source AI thì khác. Họ có thể trở nên hoài nghi hơn, khiến các dự án thực sự có giá trị khó huy động vốn.
Về mặt đầu tư, tôi sẽ không vội vàng. Hãy chờ xem họ có thực sự mở source code và weight không. Hãy chờ xem điểm GAIA của họ là bao nhiêu. Nếu mọi thứ chỉ dừng lại ở MCP score, thì đây là một "món hàng" cần tránh xa.
Takeaways: Sóng vỗ, ai đứng vững?
Sóng vỗ, ai đứng vững?
Trong thị trường crypto và AI, khi một ai đó hét to "best", hãy kiểm tra code. Đừng để cảm xúc – hay niềm tin vào một cái tên nổi tiếng – lấn át phân tích. Mira Murati từng là CTO của OpenAI, nhưng điều đó không biến Inkling thành siêu phẩm.
Bài học từ ArtBlocks vẫn còn đó: giá trị thực không đến từ câu chuyện, mà đến từ sản phẩm thực tế. Hãy để những con số kỹ thuật lên tiếng, chứ không phải những dòng tweet hoành tráng.
Còn bây giờ, tôi sẽ đứng ngoài và quan sát. Đợi khi model thực sự mở, benchmark thực sự công bố, cộng đồng thực sự thử nghiệm – lúc đó mới là lúc hành động.
Sóng vỗ. Ai đứng vững? Câu trả lời sẽ đến từ code, không phải từ press release.
