
Xiaomi MiMo-V2.6 là một bản phát hành trọng số mở đáng chú ý. Thay vì chỉ cung cấp bộ trọng số, Xiaomi công khai cả chi phí và một phần quá trình học tăng cường. Công ty phát hành mô hình theo giấy phép MIT và cam kết mở hơn 7.000 môi trường tác vụ cùng một khung huấn luyện đầu cuối.
Thomas Wolf là đồng sáng lập kiêm giám đốc khoa học của Hugging Face. Ông gọi đây là “mức độ cởi mở ấn tượng đối với một lượt huấn luyện lớn như vậy”. Tuy nhiên, mức độ đóng góp cuối cùng vẫn phụ thuộc vào việc Xiaomi có phát hành đầy đủ các môi trường và công cụ đã hứa hay không.
Theo bài viết gốc của The New Stack, MiMo-V2.6 đáng chú ý không chỉ vì quy mô và điểm chuẩn. Xiaomi còn cho cộng đồng theo dõi cách mô hình được huấn luyện và công bố những thành phần dự kiến phát hành sau đó.
MiMo-V2.6 xuất hiện giữa lúc các phòng thí nghiệm trí tuệ nhân tạo liên tục giới thiệu mô hình mới. Cùng ngày Xiaomi công bố mô hình, Anthropic giới thiệu Claude Opus 5.5, còn OpenAI ra mắt GPT-6 Sol và Luna.
MiMo-V2.6-Pro có quy mô một nghìn tỷ tham số
MiMo-V2.6-Pro có một nghìn tỷ tham số, nhưng chỉ 42 tỷ tham số hoạt động tại một thời điểm. Mô hình xử lý văn bản, hình ảnh, âm thanh và video trong cửa sổ ngữ cảnh một triệu token. Kết quả của Artificial Analysis xếp mô hình đứng đầu nhóm trọng số mở mà tổ chức này theo dõi.
Theo The New Stack, cửa sổ ngữ cảnh của MiMo-V2.6-Pro đặt mô hình vào cùng nhóm với những hệ thống tiên tiến mới nhất. GPT-6 Sol hỗ trợ 1,05 triệu token, trong khi Claude Opus 5.5 hỗ trợ một triệu token. OpenAI và Anthropic không công bố số tham số tương đương, nên chưa thể đối chiếu trực tiếp quy mô của ba mô hình.
Xiaomi tuyên bố MiMo-V2.6 đạt hiệu năng tiên tiến trong lập trình, tác vụ tác tử, an ninh mạng, xử lý đa phương thức và nghiên cứu. Theo Artificial Analysis, MiMo-V2.6-Pro đạt 46 điểm trên Chỉ số Trí tuệ. Mô hình đứng đầu trong 114 mô hình lớn có trọng số mở mà tổ chức này theo dõi.
Khả năng lập trình và thực hiện chuỗi hành động dài đặt MiMo-V2.6-Pro vào cùng xu hướng với các tác tử trí tuệ nhân tạo viết mã. Điểm khác biệt được quan tâm nhiều hơn là lượng thông tin Xiaomi công khai về quá trình học tăng cường.
Năm ngày phát trực tiếp quá trình học tăng cường
Xiaomi phát trực tiếp một lượt học tăng cường của MiMo-V2.6 trong năm ngày, bắt đầu từ ngày 15 tháng 9. Bảng điều khiển công khai cho phép người xem theo dõi số liệu huấn luyện thực tế và ghi nhận tổng chi phí khoảng 3,5 triệu USD cho hai phiên bản Flash và Pro.

Khi quá trình kết thúc, bảng điều khiển ghi nhận chi phí 854.044 USD cho MiMo-V2.6-Flash và 2.620.670 USD cho MiMo-V2.6-Pro. The New Stack lưu ý các con số này chỉ bao gồm giai đoạn học tăng cường. Xiaomi chưa công bố chi phí tiền huấn luyện.
Việc công khai chi phí học tăng cường vẫn hiếm trong ngành. The New Stack dẫn lại số liệu của MiniMax-M1, một mô hình có 456 tỷ tham số. MiniMax cho biết giai đoạn học tăng cường tốn 534.700 USD tiền thuê bộ xử lý đồ họa. DeepSeek công bố chi phí học tăng cường của R1, mô hình 671 tỷ tham số, là 294.000 USD.
Những số liệu này không tạo thành phép so sánh hoàn toàn tương đương. MiMo-V2.6-Pro có quy mô lớn hơn, còn lượt huấn luyện của mô hình hướng đến các tác vụ tác tử dài hơn. Với những hệ thống như vậy, hạ tầng và cách đánh giá từng hành động cũng quan trọng như bộ trọng số cuối cùng. Đây là một phần của quá trình xây dựng hạ tầng trí tuệ nhân tạo.
Sáu tháng mở rộng quy mô học tăng cường
Nhóm MiMo dành gần sáu tháng để kiểm tra khả năng mở rộng của học tăng cường. Xiaomi tăng lượng tính toán, số loại môi trường, cách thiết lập tác tử và nguồn lực chấm kết quả. Quy mô được Fuli Luo mô tả ở mức khoảng hai tỷ token mỗi bước trong một quy trình hoàn toàn bất đồng bộ.
Fuli Luo, người đứng đầu nhóm MiMo của Xiaomi và từng làm việc tại DeepSeek, cho biết nhóm đã thử mở rộng nhiều thành phần của quá trình huấn luyện. Theo nội dung được The New Stack dẫn lại, Xiaomi sử dụng 1.568 câu lệnh đầu vào nhân với 16 lượt chạy cho mỗi bước.
Luo cho biết Xiaomi sẽ lần lượt mở mã nguồn các chi tiết trong những tuần tiếp theo. Việc công bố lộ trình này cho phép cộng đồng đánh giá bản phát hành dựa trên cả những tài nguyên đã có và những thành phần vẫn đang được chuẩn bị.
Nhận xét của Thomas Wolf phản ánh điểm khác biệt giữa MiMo-V2.6 và nhiều bản phát hành trọng số mở khác. Cộng đồng được nhìn thấy một phần quá trình tạo ra mô hình, thay vì chỉ nhận sản phẩm sau cùng.
Giấy phép MIT và hơn 7.000 môi trường được hứa hẹn
Xiaomi đã phát hành trọng số MiMo-V2.6 theo giấy phép MIT, kèm báo cáo kỹ thuật và một mô hình chín tỷ tham số dựa trên Qwen. Công ty cũng cam kết mở hơn 7.000 môi trường tác vụ và một khung huấn luyện đầu cuối, nhưng phần lớn tài nguyên này chưa xuất hiện tại thời điểm bài gốc được viết.
Theo The New Stack, mô hình chín tỷ tham số được thiết kế làm điểm khởi đầu cho các nghiên cứu tiếp theo về học tăng cường dành cho tác tử.
Trên trang giới thiệu MiMo-V2.6 của Xiaomi, công ty tuyên bố sẽ mở thêm tài nguyên học tăng cường. Phần được hứa hẹn gồm hơn 7.000 môi trường tác vụ. Chúng bao phủ kỹ thuật phần mềm, tái tạo lỗ hổng, công việc tri thức và phát triển web.
Nội dung Xiaomi cam kết phát hành
Xiaomi cũng công bố kế hoạch phát hành một khung huấn luyện đầu cuối. Khung này bao phủ quá trình tương tác với môi trường, đánh giá phần thưởng và tối ưu hóa chính sách. Các bộ khung tác tử gọn nhẹ sẽ hỗ trợ thử nghiệm nhiều công cụ, câu lệnh đầu vào và cách bố trí ngữ cảnh.
Tại thời điểm bài gốc được viết, bộ sưu tập của Xiaomi trên Hugging Face mới hiển thị ba bản phát hành mô hình. Hơn 7.000 môi trường cùng những tài nguyên hỗ trợ khác chưa xuất hiện tại đó. Vì Luo nói các thành phần sẽ được mở dần trong những tuần tiếp theo, quy mô đóng góp thực tế vẫn phụ thuộc vào những gì Xiaomi phát hành sau lời hứa.
Elie Bakouch từng là nghiên cứu viên Hugging Face và hiện là kỹ sư nghiên cứu tại Prime Intellect. Ông chú ý đến số tài nguyên học tăng cường được cam kết. Theo phát biểu được The New Stack dẫn lại, Xiaomi dự định phát hành khoảng 7.000 bộ dữ liệu huấn luyện. Công ty cũng dự định mở khung phần mềm đã tạo ra mô hình thuộc nhóm sáu vị trí dẫn đầu trên Artificial Analysis.
Bakouch cũng lưu ý rằng mô hình và báo cáo kỹ thuật được phát hành chưa đầy một tuần sau khi lượt học tăng cường cuối cùng bắt đầu.
Vì sao môi trường huấn luyện ngày càng có giá trị
Môi trường học tăng cường quyết định tác vụ nào mô hình được thực hành và cách kết quả được chấm. Với phần thưởng có thể xác minh, hệ thống có thể tự động kiểm tra đầu ra, chẳng hạn xác định đoạn mã có vượt qua bài kiểm thử hay không. Vì vậy, môi trường và tiêu chí đánh giá là tài nguyên nghiên cứu có giá trị độc lập.
Thomas Wolf cho rằng việc phát hành nhiều môi trường học tăng cường chất lượng cao có thể là đóng góp có tác động lớn nhất đối với tiến bộ của hệ sinh thái mở hiện nay. Theo lập luận được The New Stack ghi lại, vai trò của các môi trường này tương tự dữ liệu tiền huấn luyện chất lượng cao trong giai đoạn phát triển trước.
Phương pháp học tăng cường với phần thưởng có thể xác minh phù hợp với các tác vụ có kết quả được kiểm tra tự động. Khi kết quả có thể được chấm rõ ràng, chất lượng môi trường và bộ tiêu chí đánh giá trở thành phần cốt lõi của quá trình huấn luyện.
Cách tiếp cận này liên quan trực tiếp đến bài toán xác minh trong quy trình xử lý số lượng lớn yêu cầu mã. Một tác tử có thể tạo đầu ra nhanh, nhưng hệ thống vẫn cần môi trường đủ tốt để xác định đầu ra nào thực sự đúng.
Trọng số mở không đồng nghĩa với mã nguồn mở
Trọng số mở cho phép người dùng tải các giá trị số mà mô hình đã học để chạy hoặc tinh chỉnh, nhưng không bảo đảm quyền tiếp cận dữ liệu, mã huấn luyện, môi trường hay quy trình đánh giá. MiMo-V2.6 công khai nhiều thành phần hơn phần lớn bản phát hành cùng loại, song chưa thể được đánh giá chỉ dựa trên bộ trọng số.
Những thành phần cần có ngoài bộ trọng số
Một dự án mã nguồn mở đầy đủ cung cấp nhiều hơn bộ trọng số. Nhà nghiên cứu bên ngoài cần tài liệu và công cụ để kiểm tra cách hệ thống được xây dựng. Họ cũng cần khả năng lặp lại một phần quy trình hoặc phát triển tiếp từ nền tảng đã có. Khác biệt này nằm trong tranh luận rộng hơn về việc trí tuệ nhân tạo nên mở hay đóng.
Theo The New Stack, Meta từng gọi các mô hình Llama là mã nguồn mở dù giấy phép đi kèm có những hạn chế đáng kể. Những người ủng hộ mã nguồn mở đã phản đối cách mô tả đó.
MiMo-V2.6 tiến xa hơn phần lớn các bản phát hành cùng loại vì giấy phép MIT không đặt ra điều kiện riêng cho người dùng thương mại quy mô lớn như những hạn chế được gắn với Kimi K3 của Moonshot và Qwen3.8-Max của Alibaba.
Đánh giá cuối cùng vẫn phụ thuộc vào việc Xiaomi có phát hành đầy đủ các môi trường và công cụ đã cam kết hay không. Hiện tại, trọng số, báo cáo kỹ thuật và mô hình chín tỷ tham số đã tạo nên một hồ sơ công khai hiếm thấy. Hồ sơ này còn có dữ liệu theo dõi lượt học tăng cường. Nếu hơn 7.000 môi trường cùng khung huấn luyện xuất hiện đúng kế hoạch, các nhóm nghiên cứu bên ngoài sẽ có thêm tài nguyên để kiểm tra và phát triển tiếp quy trình hậu huấn luyện.
Hãy tiếp tục theo dõi Sine để cập nhật những bước mở tiếp theo của Xiaomi và tác động của chúng đối với cộng đồng trí tuệ nhân tạo.


