
Theo bài phân tích của The New Stack, mô hình trọng số mở xử lý 56% lượng token đi qua Vercel AI Gateway trong tháng 8 năm 2026, nhưng chỉ chiếm 14% chi phí ước tính. Các mô hình Anthropic đi theo chiều ngược lại khi chiếm 64% chi tiêu ước tính qua AI Gateway. Khoảng cách này cho thấy các mô hình chi phí thấp đang mở rộng nhanh về lượng sử dụng. Tỷ trọng token cao của mô hình trọng số mở không tương ứng với tỷ trọng chi phí của nhóm này.
Xu hướng tương tự đã xuất hiện trên OpenRouter. Theo The New Stack, mô hình trọng số mở chiếm 60% lượng token tiêu thụ tại Mỹ trên OpenRouter trong tháng 8. Các mô hình do Trung Quốc phát triển đóng góp phần lớn lưu lượng đó. Diễn biến này cũng phù hợp với bức tranh AI Trung Quốc dẫn đầu token trọng số mở tại Mỹ.
Mô hình trọng số mở lần đầu vượt mốc 50%
Mô hình trọng số mở lần đầu chiếm đa số lượng token theo tháng trên Vercel AI Gateway. Theo báo cáo tháng 9 của Vercel, số liệu này bao quát hoạt động đến hết tháng 8 năm 2026. Nhóm mô hình trọng số mở xử lý 56% tổng số token được chuyển qua cổng.
Đà tăng trong tám tháng
Theo dữ liệu của Vercel, mức tăng diễn ra trong chưa đầy một năm. Tỷ trọng token của mô hình trọng số mở tăng từ 7% vào tháng 12 năm 2025 lên 13% trong tháng 4 năm 2026. Con số này đạt 36% trong tháng 7 và tiếp tục tăng lên 56% trong tháng 8.
Theo Vercel, ngày 22 tháng 8 lập một kỷ lục riêng khi mô hình trọng số mở chiếm 62% lưu lượng token trên AI Gateway. Tổng giám đốc Vercel Guillermo Rauch nhận định xu hướng có thể mới ở giai đoạn đầu vì doanh nghiệp chưa áp dụng rộng rãi. Các bộ công cụ, giao diện dòng lệnh, môi trường phát triển tích hợp và bộ phát triển phần mềm cũng cần giảm sự phụ thuộc vào từng mô hình cụ thể.
Nhiều token không đồng nghĩa với nhiều tiền
Chi phí theo nội dung xử lý
Tỷ trọng token đo lượng công việc mô hình xử lý, không đo tỷ trọng doanh thu hoặc chi phí. Theo Vercel, trong tháng 8, mô hình trọng số mở xử lý 56% token trên AI Gateway nhưng chỉ chiếm 14 xu trong mỗi đô la Mỹ chi tiêu ước tính qua cổng.
Vercel đưa AI Gateway vào hoạt động trong năm trước để cung cấp cho nhà phát triển một giao diện chung nhằm truy cập mô hình của nhiều nhà cung cấp. Thay vì quản lý riêng khóa giao diện lập trình ứng dụng, tài khoản và giới hạn tốc độ cho từng hãng, ứng dụng gửi yêu cầu qua cổng. Vercel định tuyến yêu cầu, đồng thời theo dõi mức sử dụng và chi phí.
Theo cách tính của Vercel, khối lượng token gồm token đầu vào, token đầu ra, token suy luận, token đầu vào được lưu đệm và token dùng để tạo bộ nhớ đệm. Chỉ số này phản ánh lượng suy luận đi qua hệ thống, không phản ánh tỷ trọng chi tiêu ước tính được quy cho mô hình của từng nhà cung cấp.
Sự khác biệt giữa lượng sử dụng và chi phí đặc biệt quan trọng khi đánh giá hạ tầng AI và cách vận hành. Các mô hình trọng số mở của DeepSeek, Moonshot AI và Z.ai thường có chi phí thấp hơn mô hình độc quyền từ các phòng thí nghiệm hàng đầu tại Mỹ. Vì vậy, tỷ trọng token cao không tự động dẫn đến tỷ trọng chi phí tương ứng.

Chi phí trên mỗi token tiếp tục giảm
Vercel cho biết tỷ trọng chi phí của mô hình trọng số mở vẫn đang tăng, nhưng còn cách xa tỷ trọng sử dụng. Giá trung bình trên mỗi token của toàn bộ AI Gateway giảm 23,2% trong tháng 8, đánh dấu tháng giảm thứ ba liên tiếp.
Theo Vercel, trong nhóm khách hàng xử lý hơn 10 triệu token ở cả tháng 7 và tháng 8, chi phí trung vị trên mỗi token giảm 7,6%. Con số này cho thấy chi phí suy luận giảm ngay cả khi chỉ xét những khách hàng có khối lượng sử dụng lớn trong cả hai tháng.
Anthropic vẫn chiếm 64% chi phí
Theo Vercel, các mô hình Anthropic chiếm 64% chi tiêu ước tính qua AI Gateway vào tháng 8, dù mô hình trọng số mở dẫn đầu về lượng token. Cũng theo Vercel, từ tháng 12 năm 2025, tỷ trọng chi phí của Anthropic chưa từng thấp hơn 61% trong bất kỳ tháng nào.
Theo Vercel, các mô hình Anthropic giữ hai vị trí đầu về chi phí trong toàn bộ giai đoạn theo dõi. Chúng cũng nhiều lần chiếm vị trí thứ ba. Dữ liệu cho thấy lượng token và giá trị chi tiêu có thể dịch chuyển theo hai hướng khác nhau. Các số liệu này không cho biết loại tác vụ nào tạo ra phần chi phí cao hơn.

Khách hàng trung thành với đặc tính mô hình
Khách hàng có thể đổi mô hình nhưng vẫn ở lại với cùng một nhà cung cấp nếu mô hình mới giữ được những đặc tính họ cần. Trên Vercel AI Gateway, chi tiêu chuyển mạnh từ Fable 5 sang Opus 5 trong tháng 8, nhưng tổng tỷ trọng của Anthropic vẫn ở mức cao.
Chi tiêu chuyển từ Fable sang Opus
Vercel ghi nhận Fable 5 giảm từ 13,2% tổng chi tiêu trên cổng trong tháng 7 xuống 4,9% vào tháng 8. Trong cùng thời gian, Opus 5 có giá thấp hơn tăng lên 22,5%.
Theo Vercel, 90% nhóm khách hàng dùng Fable đã giảm mức sử dụng mô hình này. Nhiều khối lượng công việc chuyển sang Opus 5 hơn bất kỳ mô hình nào khác. Lượng sử dụng mà Opus thu hút tăng gần gấp đôi phần Fable đánh mất.
Vercel lý giải rằng Opus 5 có thể xử lý các khối lượng công việc tương tự với mức giá xấp xỉ một nửa. Khách hàng chuyển sang mô hình rẻ hơn nhưng vẫn ở lại trong hệ sinh thái Anthropic, giúp các mô hình của hãng tiếp tục chiếm phần lớn chi tiêu ước tính qua cổng. Nhóm tác giả báo cáo kết luận rằng lòng trung thành đi theo đặc tính mô hình hơn là tên nhà cung cấp, trong đó tính ổn định giữ vai trò quyết định.

Người dùng sẵn sàng đổi nhà cung cấp
Khách hàng có thể đổi nhà cung cấp nếu phương án thay thế trong cùng hãng không đáp ứng các nhu cầu tương tự về năng lực và giá. Dữ liệu về Z.ai và Google cho thấy lưu lượng có thể chuyển nhanh cả giữa các phiên bản cùng hãng lẫn giữa những nhà cung cấp khác nhau.
Theo dữ liệu được The New Stack dẫn lại, trong năm ngày sau khi Z.ai ra mắt GLM-5.3-Flash, mô hình mới xử lý lượng token hằng ngày gấp ba lần GLM-5.2. Dữ liệu này không xác định nguyên nhân khiến lưu lượng chuyển sang mô hình mới.
Lưu lượng chuyển sang nhà cung cấp khác
Dữ liệu Vercel cũng cho thấy hơn ba phần tư lượng token mà Gemini 3 Flash của Google đánh mất đã chuyển sang mô hình của các nhà cung cấp khác, gồm OpenAI và Anthropic.
Tỷ trọng token của Google trên AI Gateway giảm từ 30% xuống 5%. Theo Vercel, riêng sự suy giảm của Gemini 3 Flash đóng góp 22 trong tổng số 25 điểm phần trăm bị mất.
Lựa chọn mô hình vì thế ngày càng trở thành một quyết định ở tầng ứng dụng. Với các hệ thống như tác tử AI viết mã, nhà phát triển có thể chuyển sang mô hình khác nếu mô hình đó giữ được năng lực cần thiết với chi phí thấp hơn. Nhóm tác giả báo cáo Vercel kết luận rằng nhà cung cấp giữ được khách hàng khi mô hình mới bảo toàn điều người dùng coi trọng ở phiên bản trước. Nếu không, khách hàng sẽ tìm sản phẩm phù hợp từ hãng khác.
Hãy tiếp tục theo dõi Sine để cập nhật những thay đổi đáng chú ý về mô hình AI, chi phí suy luận và hạ tầng triển khai.


