Thị trường · ✦ AI tổng hợp
Grok 4.5 dẫn đầu bảng xếp hạng AI agent, củng cố tuyên bố của Elon Musk
Grok 4.5 của xAI đứng đầu bảng xếp hạng AutomationBench-AA với điểm số 51,4%, vượt qua Claude Fable 5 và Claude Opus 4.8. Mô hình này cũng có chi phí chỉ 0,34 USD mỗi tác vụ, thấp hơn đáng kể so với các đối thủ, phần lớn nhờ hiệu quả sử dụng token vượt trội.
Grok 4.5 dẫn đầu bài kiểm tra AI agent độc lập
xAI vừa ra mắt Grok 4.5 cho công chúng trong tuần này, được xây dựng trên nền tảng V9 với 1,5 nghìn tỷ tham số. Khi công bố mô hình, Elon Musk khẳng định Grok 4.5 đạt chất lượng ngang tầm Claude Opus nhưng chạy nhanh hơn và chi phí thấp hơn — một tuyên bố lúc đó chủ yếu dựa trên đánh giá nội bộ.
Nay, một bài kiểm tra độc lập đã cung cấp cơ sở thực tế cho nhận định đó.
AutomationBench-AA: Bài kiểm tra khách quan cho AI agent
Artificial Analysis vận hành AutomationBench-AA như một bảng xếp hạng độc lập, với bộ tác vụ được giữ bí mật để tránh việc các mô hình "học thuộc" bài kiểm tra. Benchmark này bao gồm 657 tác vụ trải rộng trên 40 ứng dụng mô phỏng, trong đó có Gmail, Slack, Salesforce và HubSpot. Tiêu chí chấm điểm là tỷ lệ mục tiêu mà AI agent hoàn thành mà không vi phạm các ràng buộc an toàn.
Kết quả: Grok 4.5 đạt 51,4%, vượt qua Claude Fable 5 (48,6%) và Claude Opus 4.8 (48,5%).
Chi phí thấp nhờ hiệu quả token
Điểm nổi bật không kém là chi phí vận hành. Grok 4.5 tiêu tốn 0,34 USD mỗi tác vụ, thấp hơn nhiều so với Fable 5 ở mức 1,35 USD và Opus 4.8 ở mức 1,46 USD. Gemini 3.5 Flash là đối thủ gần nhất với 0,49 USD.
Nguyên nhân chính đến từ hiệu quả sử dụng token: Grok 4.5 chỉ tạo ra khoảng 8.000 token đầu ra mỗi tác vụ, tương đương khoảng một phần tư so với Opus 4.8. Tổng lượng token sử dụng đạt 0,44 triệu mỗi tác vụ — thuộc nhóm thấp nhất trên bảng xếp hạng.
Theo Artificial Analysis: "Chi phí thấp được thúc đẩy bởi hiệu quả sử dụng token cũng như mức giá token cạnh tranh."
Hiệu suất theo lĩnh vực và điểm cần lưu ý
Grok 4.5 hoàn thành 79,9% mục tiêu tác vụ và vượt qua hoàn toàn 21,9% tác vụ. Trong lĩnh vực Tài chính — được đánh giá là khó nhất — mô hình này dẫn đầu với tỷ lệ 71%, so với 64% của Fable 5 và 62% của Opus 4.8.
Tuy nhiên, có một điểm đáng chú ý: Grok 4.5 ghi nhận 0,63 vi phạm ràng buộc an toàn mỗi tác vụ, cao hơn so với Opus 4.8 (0,55) và Gemini 3.5 Flash (0,46). Đây là yếu tố quan trọng đối với các doanh nghiệp triển khai AI agent trong hệ thống tài chính thực tế, nơi mỗi vi phạm đều có thể dẫn đến hậu quả thực sự.
Nhận định tổng quan
Kết quả từ AutomationBench-AA cho thấy Grok 4.5 có lợi thế rõ ràng về hiệu quả chi phí và hiệu suất tổng thể trong môi trường agentic. Tuy nhiên, tỷ lệ vi phạm ràng buộc cao hơn là điều mà các tổ chức cần cân nhắc kỹ trước khi triển khai trong các môi trường đòi hỏi độ tin cậy cao.
/ Bài viết liên quan
[Wintermute] Market Update 14 September 2026
Wintermute — Cập nhật thị trường. Bấm để đọc bản gốc trên wintermute.com.
[Wintermute] Market Update 7 September 2026
Wintermute — Cập nhật thị trường. Bấm để đọc bản gốc trên wintermute.com.
[Wintermute] Rwas The Next Liquidity Channel
Wintermute — Góc nhìn. Bấm để đọc bản gốc trên wintermute.com.
[Wintermute] Market Update 31 August 2026
Wintermute — Cập nhật thị trường. Bấm để đọc bản gốc trên wintermute.com.