Intel dùng BITCOS đưa một checkpoint xuống 1,485 bit

Intel dùng BITCOS để nén một LLM tam phân xuống 1,485 bit mỗi trọng số mà không huấn luyện lại, đồng thời tăng thông lượng giải mã trên một số cấu hình Intel.

Hình minh họa chung về chip xử lý dữ liệu trí tuệ nhân tạo
Hình minh họa chip xử lý dữ liệu.

Intel đã nén một điểm kiểm tra LLM tam phân xuống 1,485 bit cho mỗi trọng số bằng định dạng BITCOS, thấp hơn mức lý thuyết 1,58 bit thường được nhắc đến. Phương pháp này không cần huấn luyện lại hoặc thay đổi trọng số. Trong các cấu hình Intel được thử nghiệm, thông lượng giải mã tăng tối đa 18% trên bộ xử lý trung tâm và 27% trên bộ xử lý đồ họa.

Theo bài viết gốc của The New Stack, kết quả đến từ cách lưu dữ liệu thay vì một mô hình mới. BITCOS tận dụng thực tế rằng một số mô hình tam phân có nhiều trọng số bằng không hơn giả định lý thuyết. Điều này liên quan trực tiếp đến vận hành hạ tầng trí tuệ nhân tạo, nơi lượng dữ liệu truyền qua bộ nhớ có thể giới hạn tốc độ suy luận.

Vì sao mô hình tam phân thường được gọi là 1,58 bit?

Theo phần giải thích của The New Stack dựa trên nghiên cứu Intel, mô hình tam phân chỉ dùng ba giá trị trọng số: −1, 0 và +1. Nếu ba giá trị xuất hiện với xác suất bằng nhau, lượng thông tin tối thiểu để biểu diễn mỗi trọng số là khoảng 1,58 bit. Cách lưu trên phần cứng thường tốn nhiều dung lượng hơn mức lý thuyết này.

The New Stack cho biết phương pháp phổ biến đóng gói năm giá trị tam phân vào một byte tám bit, tương đương trung bình 1,6 bit cho mỗi trọng số. Khi trọng số được chia thành các khối 128, byte cuối có thể không được dùng hết, đẩy chi phí thực tế lên 1,625 bit cho mỗi trọng số.

Theo nghiên cứu BITCOS của Intel được The New Stack dẫn lại, nhóm nghiên cứu khảo sát 29 điểm kiểm tra thuộc bảy họ mô hình tam phân. Tỷ lệ trọng số bằng không nằm trong khoảng 29,7% đến 51,5%. Trong số đó, 26 điểm kiểm tra có đủ trọng số bằng không để BITCOS dùng ít dung lượng hơn phương pháp đóng gói năm giá trị tam phân.

Theo nghiên cứu BITCOS của Intel được The New Stack dẫn lại, trường hợp thưa nhất là phiên bản tam phân của Qwen3-1.7B được tạo bằng phương pháp lượng tử hóa sau huấn luyện CAT-Q. Nhóm Intel đo được 51,48% trọng số của mô hình này bằng không, giúp BITCOS hạ chi phí lưu trữ xuống 1,485 bit cho mỗi trọng số.

Nội dung BITCOS: giảm dữ liệu dành cho trọng số bằng không như thế nào?

Hình minh họa chung về chip xử lý dữ liệu trí tuệ nhân tạo
Hình minh họa chip xử lý dữ liệu.

BITCOS tách trọng số thành hai luồng dữ liệu. Luồng thứ nhất dùng một bit cho mỗi trọng số để đánh dấu vị trí bằng không hoặc khác không. Luồng thứ hai chỉ lưu bit dấu của các trọng số khác không, vì trọng số bằng không không cần thông tin về dấu.

Theo nghiên cứu BITCOS của Intel được The New Stack dẫn lại, một trọng số dương hoặc âm cần hai bit, gồm bit hiện diện và bit dấu. Trọng số bằng không chỉ cần bit hiện diện. Nếu z là tỷ lệ trọng số bằng không, chi phí lưu trữ của BITCOS là 2 − z bit cho mỗi trọng số.

Chi phí theo công thức này là 1,6 bit khi tỷ lệ số không đạt 40% và giảm xuống 1,485 bit khi tỷ lệ đó đạt 51,5%. Sau khi giải nén, hệ thống khôi phục đúng các giá trị −1, 0 và +1 ban đầu. Vì BITCOS chỉ thay đổi định dạng lưu trữ, đầu ra và độ chính xác của mô hình không đổi.

Ngưỡng để BITCOS nhỏ hơn phương pháp đóng gói năm giá trị tam phân là 37,5% trọng số bằng không. Trong 29 điểm kiểm tra được khảo sát, 26 điểm vượt ngưỡng này.

Vì sao dung lượng nhỏ hơn có thể giúp giải mã nhanh hơn?

BITCOS có thể tăng tốc giải mã khi việc truyền trọng số qua bộ nhớ là nút thắt. Định dạng nhỏ hơn làm giảm lượng dữ liệu cần di chuyển trong quá trình tạo từng token với kích thước lô nhỏ, dù hệ thống vẫn phải dành tài nguyên để giải nén trọng số.

Đặc điểm này cũng liên quan đến cách tác tử lập trình bằng trí tuệ nhân tạo hoạt động, vì hệ thống phải liên tục tạo phản hồi thay vì chỉ xử lý một lô lớn.

Intel xây dựng các nhân giải nén riêng cho bộ xử lý trung tâm hỗ trợ AVX-512 và AVX2, cùng bộ xử lý đồ họa Xe2. Trên phần cứng AVX-512, nhân xử lý dùng bản đồ hiện diện làm mặt nạ và lệnh pdep để đưa các bit dấu đã nén về đúng vị trí của trọng số khác không.

Bộ xử lý đồ họa Xe2 không có lệnh tương đương. Theo mô tả của The New Stack, Intel thay thao tác đó bằng một bảng tra cứu có dung lượng 2 KB.

BITCOS đạt kết quả gì trên năm hệ thống Intel?

Hình minh họa chung về chip xử lý dữ liệu trí tuệ nhân tạo
Hình minh họa chip xử lý dữ liệu.

Theo số liệu thử nghiệm của Intel được The New Stack dẫn lại, BITCOS được so sánh với các nhân xử lý cố định hai bit trên năm hệ thống. BITCOS nhanh hơn 10% đến 18% trên máy chủ Xeon 64 lõi và 2% đến 15% trên Core Ultra 9 có 24 lõi. Mức cải thiện thay đổi theo phần cứng và mô hình.

Hệ thốngMức tăng thông lượng giải mã
Xeon 64 lõi10% đến 18%
Core Ultra 9, 24 lõi2% đến 15%
Arc 140V tích hợp9% đến 22%
Arc Pro B70 rời2% đến 27%

Số liệu trong bảng lấy từ thử nghiệm BITCOS của Intel được The New Stack dẫn lại.

Các số liệu chỉ đo giai đoạn giải mã sau khi mô hình đã được nạp. Thử nghiệm không tính thời gian khởi động hệ thống suy luận. Kết quả cho thấy nén trọng số có thể cải thiện tốc độ khi tải bộ nhớ là nút thắt, nhưng số bit thấp hơn không bảo đảm hiệu năng cao hơn trên mọi bộ xử lý.

Vì sao BITCOS không nhanh hơn trên mọi cấu hình?

BITCOS không thắng khi chi phí giải nén lớn hơn lợi ích từ việc giảm lưu lượng bộ nhớ. Trên bộ xử lý Lunar Lake tám lõi, nhân xử lý cố định hai bit của Intel nhanh hơn BITCOS với tất cả mô hình được thử nghiệm vì hệ thống có đủ băng thông bộ nhớ.

BITCOS vẫn nhanh hơn trên các bộ xử lý đồ họa trong thử nghiệm của Intel, dù chi phí giải mã giới hạn mức cải thiện. Lựa chọn định dạng tối ưu phụ thuộc vào thành phần đang kìm hãm khối lượng công việc, gồm năng lực tính toán, bộ nhớ hoặc băng thông.

Nghiên cứu BITCOS còn những giới hạn nào?

Theo The New Stack, kết quả BITCOS chưa thể áp dụng cho mọi hệ thống vì nghiên cứu chưa được bình duyệt và toàn bộ năm hệ thống thử nghiệm đều dùng phần cứng Intel. Phép đo đầu cuối cũng chỉ bao phủ bảy mô hình với kích thước lô bằng một.

Theo The New Stack, Intel chưa công bố thử nghiệm BITCOS trên phần cứng Nvidia, AMD hoặc Arm. Vì vậy, mức tăng tối đa 18% trên bộ xử lý trung tâm và 27% trên bộ xử lý đồ họa chỉ phản ánh các cấu hình Intel mà nhóm nghiên cứu đã kiểm tra.

Theo nghiên cứu BITCOS của Intel được The New Stack dẫn lại, chi phí lưu trữ và tốc độ suy luận của mô hình tam phân phụ thuộc vào phân bố trọng số thực tế, không chỉ số bit danh nghĩa. Với điểm kiểm tra có 51,48% trọng số bằng không, định dạng này đạt 1,485 bit cho mỗi trọng số mà không thay đổi các giá trị đã học.

Hãy tiếp tục theo dõi Sine để cập nhật những thay đổi kỹ thuật có thể tác động trực tiếp đến cách triển khai mô hình trí tuệ nhân tạo.