OpenAI giảm nửa giá token GPT-6, cache mới là đòn bẩy

OpenAI giảm 50% giá token GPT-6 Sol và Luna, nhưng tỷ lệ trúng bộ nhớ đệm và cách tái sử dụng ngữ cảnh mới quyết định tổng chi phí của tác tử AI.

Minh họa GPT-6 Sol và Luna cùng cơ chế bộ nhớ đệm
GPT-6 giảm chi phí xử lý và tái sử dụng ngữ cảnh.

OpenAI giảm khoảng một nửa giá token giao diện lập trình ứng dụng của GPT-6 Sol và Luna so với các phiên bản GPT-5.6 tương ứng, riêng token đầu ra Luna giảm 58%. Tuy nhiên, chi phí vận hành tác tử AI còn phụ thuộc vào tỷ lệ trúng bộ nhớ đệm và lượng ngữ cảnh được gửi lại. Số bước trong mỗi nhiệm vụ cũng ảnh hưởng đến chi phí. Bộ nhớ đệm hiệu quả có thể tiết kiệm thêm bằng cách hạn chế số token phải xử lý mới.

Theo bài phân tích gốc của The New Stack, Sol và Luna tiến gần Astra hơn về khả năng căn chỉnh so với GPT-5.6 Sol. Hai mẫu này vẫn chưa đạt mức của Astra. Với các nhóm vận hành tác tử AI tại Việt Nam, giá và bộ nhớ đệm cần được xem xét cùng nhau. Chỉ so sánh giá niêm yết sẽ không phản ánh đầy đủ chi phí.

Giá token GPT-6 Sol và Luna giảm một nửa

Giá token đầu vào và đầu ra của GPT-6 Sol đều giảm 50% so với GPT-5.6 Sol. GPT-6 Luna cũng giảm 50% giá token đầu vào, còn giá token đầu ra giảm 58%. Các mức giá này áp dụng cho token cần được xử lý mới, chưa phản ánh phần tiết kiệm từ bộ nhớ đệm.

Theo công bố của OpenAI, GPT-5.6 Sol có giá khuyến mại 4 USD cho mỗi một triệu token đầu vào và 20 USD cho mỗi một triệu token đầu ra. GPT-6 Sol giảm các mức này xuống lần lượt còn 2 USD và 10 USD.

Mô hìnhĐầu vàoĐầu ra
GPT-5.6 Sol4 USD20 USD
GPT-6 Sol2 USD10 USD
GPT-5.6 Luna0,20 USD1,20 USD
GPT-6 Luna0,10 USD0,50 USD

Các mức giá trong bảng được tính cho mỗi một triệu token. Giá Luna do OpenAI công bố cho thấy token đầu vào giảm từ 0,20 USD xuống 0,10 USD, trong khi token đầu ra giảm từ 1,20 USD xuống 0,50 USD.

Mức giảm này làm chi phí cho mỗi lượt xử lý mới thấp hơn. Nó chưa phản ánh toàn bộ hóa đơn của một tác tử làm việc qua nhiều bước, vì cùng một phần ngữ cảnh có thể xuất hiện trong nhiều yêu cầu liên tiếp.

Bộ nhớ đệm tái sử dụng nội dung đã xử lý

Bộ nhớ đệm lời nhắc cho phép mô hình tái sử dụng một phần ngữ cảnh đã xử lý thay vì đọc lại toàn bộ dữ liệu trong từng lần gọi. GPT-6 Sol và Luna có tỷ lệ trúng bộ nhớ đệm mặc định cao hơn, nên tác tử có thể tính nhiều token đầu vào theo mức giá bộ nhớ đệm hơn.

Bộ nhớ đệm lời nhắc không phải tính năng mới của GPT-6. Thay đổi ở Sol và Luna nằm ở khả năng tận dụng ngữ cảnh đã lưu thường xuyên hơn.

Theo OpenAI, token đầu vào được đọc từ bộ nhớ đệm vẫn được giảm giá 90%, bằng mức áp dụng cho GPT-5.6. Phần mới không nằm ở tỷ lệ giảm giá mà ở số lần hệ thống có thể sử dụng mức giá đó.

GPT-6 Sol và Luna tái sử dụng ngữ cảnh đã xử lý
Bộ nhớ đệm giúp giảm lượng token xử lý mới.

Khi bộ nhớ đệm được dùng, mô hình không phải xử lý lại cùng một ngữ cảnh từ đầu trong mỗi lần gọi. Điều này giảm độ trễ và số token bị tính theo mức xử lý mới. Lợi ích rõ hơn trong các quy trình dài, chẳng hạn một tác tử AI viết mã liên tục đọc kho mã, lịch sử trao đổi và kết quả từ công cụ.

Thay đổi mức suy luận mà không mất bộ nhớ đệm

GPT-6 Sol và Luna cho phép nhà phát triển thay đổi mức nỗ lực suy luận mà vẫn giữ phần ngữ cảnh đã lưu. Tác tử có thể dành nhiều tài nguyên hơn cho bước khó và giảm mức suy luận ở bước đơn giản. Phần ngữ cảnh trước đó vẫn được sử dụng thay vì phải xử lý lại từ đầu.

Khả năng dùng công cụ cũng có thể thay đổi theo yêu cầu của từng bước mà không phá vỡ bộ nhớ đệm đã tạo. Một tác tử vì thế có thể chuyển giữa các công cụ trong quá trình làm việc nhưng vẫn giữ lại phần ngữ cảnh còn hữu ích.

Khả năng duy trì ngữ cảnh liên quan trực tiếp đến cách thiết kế hạ tầng AI và quy trình vận hành. Khi phần ngữ cảnh ổn định được giữ lại qua nhiều bước, nhóm phát triển có thể giảm thời gian phản hồi và lượng token phải xử lý mới.

Bảng điều khiển cho biết phần ngữ cảnh được lưu

Bảng điều khiển bộ nhớ đệm của GPT-6 Sol và Luna cho phép nhà phát triển theo dõi lượng đầu vào đã được lưu. Họ cũng có thể xem chỉ số này thay đổi theo thời gian. Công cụ chẩn đoán đánh dấu các cơ hội sử dụng bộ nhớ đệm bị bỏ lỡ để nhóm vận hành điều chỉnh cách sắp xếp ngữ cảnh.

Dữ liệu này đưa hiệu quả của bộ nhớ đệm thành một chỉ số có thể theo dõi. Thay vì chỉ nhìn vào tổng số token hoặc chi phí cuối kỳ, nhóm phát triển có thể xác định phần ngữ cảnh nào được tái sử dụng và phần nào vẫn bị xử lý lại.

Theo số liệu GitHub báo cáo cho OpenAI, các cải tiến đã làm giảm hơn 50% tỷ lệ token lời nhắc cần được xử lý mới trên hàng tỷ yêu cầu gửi tới các mô hình OpenAI. OpenAI cho biết kết quả này được ghi nhận trong vài tháng.

Minh họa bảng theo dõi bộ nhớ đệm của GPT-6
Nhóm vận hành có thể theo dõi phần ngữ cảnh được lưu.

Giá mô hình chưa quyết định toàn bộ ngân sách

Ngân sách cho tác tử AI phụ thuộc vào cả giá token và cách hệ thống quản lý ngữ cảnh. GPT-6 Sol và Luna giảm chi phí từ hai phía: giá token xử lý mới thấp hơn và khả năng tái sử dụng ngữ cảnh cao hơn. Hiệu quả thực tế còn phụ thuộc vào cấu trúc từng quy trình.

Một mức giá token thấp vẫn có thể tạo ra hóa đơn lớn nếu hệ thống liên tục gửi lại cùng ngữ cảnh mà không tận dụng bộ nhớ đệm. Tác động này tăng lên khi tác tử nhận nhiệm vụ dài và phải gọi mô hình nhiều lần.

Với các đội ngũ tại Việt Nam đang dự toán chi phí cho tác tử AI, giá niêm yết của mô hình chỉ là điểm bắt đầu. Ba chỉ số cần theo dõi là tỷ lệ trúng bộ nhớ đệm, lượng ngữ cảnh được gửi lại và số bước trong mỗi nhiệm vụ. Các chỉ số này cho biết hệ thống tận dụng được bao nhiêu từ mức giảm giá của OpenAI.

Hãy theo dõi Sine để cập nhật những thay đổi về chi phí và cách vận hành tác tử AI.