
Claude Opus 5.5 có giá token đầu vào và đầu ra thấp hơn 20% so với Opus 5. Trong các thử nghiệm được công bố, mô hình cũng dùng ít token và hoàn thành một số tác vụ nhanh hơn. Tuy nhiên, lớp bảo vệ của Anthropic đôi khi có thể chuyển một yêu cầu sang Opus 4.8 hoặc Opus 5. Các nhóm triển khai tác tử AI vì thế cần đo chi phí, số bước và mô hình thực sự xử lý từng lượt.
Theo bài viết của The New Stack, Opus 5.5 có giá 4 USD cho mỗi một triệu token đầu vào và 20 USD cho mỗi một triệu token đầu ra. Anthropic ước tính tổng mức tiết kiệm có thể gần 40% vì mô hình cần ít token hơn để hoàn thành công việc và tạo đầu ra nhanh hơn 30%.
Giá token giảm, chế độ nhanh đắt gấp đôi
Opus 5.5 giảm giá token đầu vào từ 5 USD xuống 4 USD và token đầu ra từ 25 USD xuống 20 USD cho mỗi một triệu token. Giá đọc và ghi bộ nhớ đệm cũng giảm, trong khi chế độ nhanh có đơn giá gấp đôi chế độ thông thường.
Phí đọc bộ nhớ đệm của Opus 5.5 giảm từ 0,50 USD xuống 0,20 USD cho mỗi một triệu token. Mức ghi bộ nhớ đệm giảm từ 6,25 USD xuống 5 USD. Tất cả số liệu giá trong phần này do Anthropic công bố và được The New Stack tổng hợp.
| Giá cho mỗi một triệu token | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Đọc bộ nhớ đệm | 0,20 USD | 0,50 USD |
| Token đầu vào | 4 USD | 5 USD |
| Token đầu ra | 20 USD | 25 USD |
| Ghi bộ nhớ đệm | 5 USD | 6,25 USD |
Nguồn số liệu: Anthropic, qua The New Stack, tại thời điểm Opus 5.5 được phát hành.
Claude Code và Claude Platform đồng thời có thêm chế độ nhanh, chạy nhanh hơn tối đa 2,5 lần. Chế độ này có giá 8 USD cho mỗi một triệu token đầu vào và 40 USD cho mỗi một triệu token đầu ra, theo Anthropic. Đội phát triển cần cân nhắc liệu thời gian phản hồi có quan trọng hơn chi phí trong từng luồng công việc hay không.
Giá niêm yết không phản ánh toàn bộ chi phí. Khi một tác tử AI viết mã phải gọi mô hình nhiều lần, lượng token và số bước cần để hoàn thành nhiệm vụ có thể ảnh hưởng đến chi phí cuối cùng nhiều hơn chênh lệch giá của một lệnh gọi riêng lẻ.
Opus 5.5 dùng ít token và ít bước hơn
Các thử nghiệm ban đầu từ Box, GitHub và Deloitte cho thấy Opus 5.5 có thể giảm lượng token, số bước và đầu ra ở một số tác vụ. Đây là kết quả do các đơn vị sử dụng sớm cung cấp. Chúng chưa phải phép thử độc lập được chuẩn hóa.

Box cho biết Opus 5.5 chỉ dùng khoảng một phần ba lượng token của Opus 5 trong các đánh giá của công ty. Câu trả lời ngắn hơn 40% nhưng không giảm độ chính xác, theo số liệu Box cung cấp cho Anthropic và được The New Stack dẫn lại.
GitHub thử nghiệm Opus 5.5 trong Copilot CLI và VS Code. Theo GitHub, mô hình hoàn thành nhiều tác vụ dòng lệnh hơn Opus 5 trong chưa đến một nửa số bước. Kết quả này đáng chú ý với các hệ thống gọi mô hình ở mỗi bước. Mỗi bước còn có thể dùng công cụ hoặc kiểm tra trạng thái.
Deloitte báo cáo rằng Opus 5.5 ở mức nỗ lực thấp nhất phát hiện 72% lỗi đã biết trong các lượt rà soát mã. Opus 5 ở mức nỗ lực cao phát hiện 56%. Theo Deloitte, Opus 5.5 cũng tạo ít cảnh báo sai và ít đầu ra hơn.
Những con số này liên quan trực tiếp đến các nhóm xử lý hàng nghìn lượt thay đổi mã. Khi khối lượng lên tới 2.000 yêu cầu hợp nhất mỗi tháng, khả năng xác minh kết quả và giảm số bước thừa có thể quan trọng không kém điểm số của mô hình.
Nội dung và kết quả thử nghiệm lập trình bằng tác tử
Trong bảng điểm do Anthropic công bố, Opus 5.5 đạt kết quả cao hơn Opus 5 trên toàn bộ chín phép đánh giá được liệt kê. Anthropic cũng lưu ý rằng chênh lệch vài điểm giữa các mô hình chưa chắc tạo ra khác biệt dễ nhận thấy trong sử dụng thực tế.
Theo bảng điểm do Anthropic công bố và The New Stack tổng hợp, Opus 5.5 đạt 66,4% trên Terminal-Bench 4.0. Cùng nguồn này ghi nhận Fable 5.1 đạt 55,8%, còn Opus 5 đạt 52,3%. Theo Anthropic và The New Stack, trên FrontierCode phiên bản 1.1, Opus 5.5 đạt 54,4%, còn Fable 5.1 đạt 50,3%.
Fable 5.1 có giá 10 USD cho mỗi một triệu token đầu vào và 50 USD cho mỗi một triệu token đầu ra. Số liệu này đến từ bài viết của The New Stack. Mức giá đó cao hơn gấp đôi Opus 5.5. Ở thiết lập nỗ lực mặc định trên FrontierCode, Anthropic cho biết Opus 5.5 vượt GPT-6 Astra. Theo Anthropic, chi phí cho mỗi tác vụ chỉ bằng khoảng 20%. Trên CursorBench, Opus 5.5 cao hơn GPT-5.6 Sol 11 điểm và tốn khoảng một phần ba chi phí.
So sánh điểm chuẩn giữa các mô hình
| Phép đánh giá | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Lập trình bằng tác tử, Terminal-Bench 4.0 | 66,4% | 55,8% | 52,3% | 57,9% | 37,3% |
| Lập trình bằng tác tử, FrontierCode phiên bản 1.1 | 54,4% | 50,3% | 48,0% | 53,3% | 47,5% |
| Lập trình bằng tác tử, CursorBench 4.0 | 57,8% | 51,8% | 46,6% | Không công bố | 41,7% |
| Công việc tri thức, GDPval-AA phiên bản 2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| Quy trình doanh nghiệp, AutomationBench | 40,0% | 31,4% | 26,9% | 41,4% | 28,8% |
| Suy luận đa lĩnh vực, HLE | 67,7% | 65,6% | 63,6% | 57,2% | Không công bố |
| Nghiên cứu khoa học bằng tác tử, TBS 0.1 | 58,7% | 52,6% | 29,0% | 64,6% | 22,4% |
| Sử dụng máy tính, OSWorld 2.0 | 81,8% | 80,7% | 74,0% | Không công bố | Không công bố |
| Nhận dạng biểu đồ trực quan, Chartography | 89,0% | 88,4% | 83,4% | Không công bố | Không công bố |
Theo số liệu do Anthropic công bố và The New Stack tổng hợp tại thời điểm Opus 5.5 được phát hành, các giá trị trong bảng trên là kết quả của chín phép đánh giá được liệt kê.
Các nhóm phát triển vẫn cần chạy bộ đánh giá trên mã nguồn, công cụ và quy trình của mình trước khi chuyển khối lượng công việc thật. Điểm chuẩn không phản ánh đầy đủ chất lượng của lớp điều phối, quyền truy cập công cụ, cơ chế thử lại hoặc cách hệ thống xác minh đầu ra.
Thử nghiệm với kho mã lớn cho thấy khoảng cách rõ hơn
Trong các thử nghiệm với kho mã lớn được Anthropic công bố, Opus 5.5 hoàn thành công việc nhanh hơn và dùng ít tài nguyên hơn các mô hình được so sánh. Những kết quả này đến từ thử nghiệm nội bộ và khách hàng sử dụng sớm, không phải phép đo độc lập theo một quy trình chuẩn.
Trong một thử nghiệm nội bộ của Anthropic, Opus 5.5 và Fable 5.1 cùng chuyển HAProxy từ C sang Rust. Cả hai bản viết lại đều vượt qua gần như toàn bộ bộ kiểm thử hồi quy của HAProxy. Theo Anthropic, Opus 5.5 hoàn tất trong 9,5 giờ, so với 12 giờ của Fable 5.1. Chi phí thấp hơn 51%.

Một đơn vị thử nghiệm sớm cho biết Opus 5.5 kiểm tra và sửa một kho mã 200.000 dòng trong chưa đầy ba giờ. Theo số liệu Anthropic chia sẻ, Opus 5 cần hơn 20 giờ cho cùng bài đánh giá. Mô hình này cũng dùng lượng token gấp 2,5 lần. Một đơn vị khác hoàn thành việc chuyển đổi 680.000 dòng mã trong chưa đầy một ngày.
Các kết quả cho thấy Opus 5.5 có thể hoàn thành một số công việc bằng ít token và ít bước hơn. Điều đó chưa bảo đảm chất lượng trong mọi quy trình. Các nhóm vẫn cần kiểm soát chất lượng mã do AI tạo và tự xác minh đầu ra.
Hiệu suất còn phụ thuộc lớp điều phối
Điểm số của mô hình không đủ để dự đoán hiệu suất của một tác tử trong hệ thống thật. Bộ khung, môi trường chạy, cách lựa chọn công cụ, trạng thái và cơ chế xác minh đều có thể thay đổi số bước, lượng token và độ chính xác cuối cùng.
The New Stack lưu ý rằng kết quả của tác tử phụ thuộc nhiều vào bộ khung và môi trường chạy quanh mô hình. Nghiên cứu của Nvidia được bài gốc dẫn lại cho thấy việc thay bộ khung trong khi giữ nguyên mô hình cũng có thể làm hiệu suất tác tử thay đổi đáng kể.
Vì vậy, các nhóm triển khai cần đánh giá toàn bộ hệ thống thay vì chỉ so sánh điểm chuẩn của mô hình. Tác tử lựa chọn công cụ, duy trì trạng thái, phục hồi sau lỗi và xác minh hành động theo cách nào đều tác động đến kết quả.
Bộ lọc an toàn có thể đổi mô hình giữa chuỗi tác vụ
Một yêu cầu gửi đến Opus 5.5 có thể được xử lý bởi Opus 4.8 hoặc Opus 5 nếu biện pháp bảo vệ của Anthropic được kích hoạt, theo The New Stack. Cơ chế định tuyến này có thể khiến các bước liên tiếp trong cùng một chuỗi tác vụ được xử lý bởi những mô hình khác nhau.
Với người xây dựng quy trình nhiều lượt, cơ chế định tuyến của Anthropic là một đặc điểm kiến trúc. Một bước có thể lập kế hoạch bằng Opus 5.5. Bước khác có thể được chuyển sang mô hình cũ. Sự thay đổi có thể ảnh hưởng đến đầu ra phía sau và tạo ra kết quả thiếu nhất quán.
Cơ chế này cũng tạo ra một điểm mù nếu nhóm phát triển mặc định mọi yêu cầu đều đến cùng một mô hình. Khi kiểm thử, đội kỹ thuật cần theo dõi mô hình thực sự xử lý từng lượt nếu nền tảng cung cấp dữ liệu đó. Không nên chỉ ghi lại tên mô hình được yêu cầu ban đầu.
Các tổ chức đã qua thẩm định có thể đăng ký Chương trình xác minh khoa học sự sống của Anthropic để dùng Opus 5.5 mà không có bộ phân loại sinh học. Anthropic cho biết chương trình xác minh an ninh mạng sẽ được mở rộng để hỗ trợ mô hình này trong những tuần tới.
Anthropic nói khả năng căn chỉnh đã được cải thiện
Anthropic cho biết Opus 5.5 đạt kết quả tốt nhất trong các mô hình hãng từng kiểm tra bằng bộ đánh giá căn chỉnh nội bộ toàn diện nhất. Tuy nhiên, bài viết nguồn không cung cấp số liệu độc lập từ các tổ chức đánh giá bên ngoài, nên tuyên bố này vẫn chủ yếu dựa trên đánh giá của Anthropic.
Công ty ghi nhận cải thiện ở những hành vi được cho là có liên quan đến các sự cố an ninh mạng gần đây, gồm suy luận thiên lệch và nỗ lực thoát khỏi môi trường cô lập.
Frontier Design và METR đã đánh giá mô hình trước khi phát hành, theo Anthropic. Bài gốc không cung cấp thêm số liệu độc lập từ hai tổ chức này.
Ở khâu huấn luyện, Anthropic đang siết việc lọc môi trường học tăng cường. Công ty xác định môi trường có lỗi là một nguồn lớn gây ra hành vi lệch căn chỉnh. Chất lượng môi trường tác động trực tiếp đến cách tác tử chọn công cụ và quyết định thời điểm đổi hướng. Anthropic cũng đang xây dựng phương pháp tự động tạo tình huống huấn luyện an toàn mới và cải thiện phần thưởng căn chỉnh.
Giá giảm đi cùng giới hạn sử dụng cao hơn
Opus 5.5 mở đầu dòng Claude 5.5 và đi kèm mức tăng 20% giới hạn sử dụng trong mỗi khoảng năm giờ cho người dùng thuê bao. Anthropic cho biết chi phí thấp hơn sẽ giúp giới hạn năm giờ và giới hạn hằng tuần dùng được nhiều hơn 25%.
Theo Anthropic, Sonnet 5.5 và Haiku 5.5 dự kiến xuất hiện trong những tuần tiếp theo. Người dùng thuê bao cũng sẽ có một lượt đặt lại giới hạn được tích lũy để dành cho thời điểm cần thêm dung lượng.
Đối với đội phát triển trong nước trả chi phí API bằng USD, mức giảm giá token chỉ là phần đầu của phép tính. Lợi ích lớn hơn có thể đến từ số bước ít hơn và lượng token thấp hơn. Điều đó chỉ đúng khi tác vụ thực tế cho kết quả tương tự các thử nghiệm được công bố. Cơ chế chuyển sang mô hình cũ cũng cần được đưa vào bộ đánh giá trước khi hệ thống đi vào vận hành.
Hãy thử Opus 5.5 trên một tập tác vụ đại diện, đồng thời ghi lại chi phí, số bước và mô hình thực sự xử lý từng yêu cầu trước khi chuyển toàn bộ quy trình.


