Claude Opus 5.5 và Opus 5: Rẻ, nhanh nhưng không hơn

Claude Opus 5.5 hoàn thành ba bài kiểm tra nhanh hơn và rẻ hơn Opus 5, nhưng hai mô hình đạt cùng kết quả về độ chính xác.

Hình minh họa phép so sánh khả năng suy luận của Claude Opus 5.5 và Opus 5
So sánh hiệu quả suy luận giữa hai phiên bản Claude Opus

Claude Opus 5.5 rẻ hơn và nhanh hơn Opus 5 trong ba bài kiểm tra suy luận của The New Stack. Tuy nhiên, phiên bản mới không tạo ra câu trả lời chính xác hơn. Theo bài thử nghiệm Claude Opus 5.5 và Opus 5 của The New Stack, cả hai cùng giải đúng hai bài. Hai mô hình cũng cùng thất bại ở bài còn lại.

Opus 5.5 hoàn thành toàn bộ phép thử trong 31 phút 45 giây với chi phí 3,95 USD. Opus 5 cần 46 phút 49 giây và tốn 6,55 USD. Kết quả cho thấy phiên bản mới tiết kiệm thời gian và chi phí, nhưng phạm vi ba bài thử chưa chứng minh khả năng suy luận tốt hơn.

Anthropic tuyên bố điều gì về Opus 5.5?

Theo The New Stack, Anthropic cho biết Opus 5.5 có hiệu năng ngang Claude Fable 5.1. Công ty cũng tuyên bố mô hình này giảm khoảng 40% chi phí trong khối lượng công việc thông thường và tạo đầu ra nhanh hơn trên 30%. Kết quả thử nghiệm thực tế xác nhận lợi thế chi phí, nhưng ghi nhận mức tăng tốc thấp hơn tuyên bố này.

Giá giao diện lập trình ứng dụng của Opus 5.5 là 4 USD cho mỗi một triệu token đầu vào và 20 USD cho mỗi một triệu token đầu ra. Opus 5 có mức tương ứng là 5 USD và 25 USD, theo số liệu The New Stack dẫn lại.

Chênh lệch đơn giá tạo ra mức tiết kiệm 20%. Để đạt mức giảm chi phí 40% mà Anthropic công bố, phần tiết kiệm còn lại phải đến từ việc Opus 5.5 sử dụng ít token hơn.

Khác biệt này ảnh hưởng trực tiếp đến các nhóm vận hành nhiều tác vụ trí tuệ nhân tạo. Câu chuyện một nhóm nhỏ kỹ sư sử dụng phần lớn lượng token cho thấy mức tiêu thụ có thể tập trung nhanh trong môi trường phát triển phần mềm.

Nội dung và cách hai mô hình được kiểm tra

The New Stack gọi Opus 5.5 và Opus 5 qua giao diện lập trình ứng dụng của Anthropic bằng các câu lệnh giống hệt nhau. Mỗi bài được chạy một lần trên từng mô hình. Cả hai dùng cùng chế độ suy luận thích ứng và mức nỗ lực mặc định để so sánh câu trả lời, thời gian, token và chi phí.

Opus 5.5 không cho phép tắt suy luận nên cả hai mô hình đều dùng chế độ suy luận thích ứng. Tác giả dự định chạy lại nếu hai phiên bản cho kết quả khác nhau, nhưng điều đó không xảy ra.

Thử nghiệm gồm ba bài. Phép thử lưới logic yêu cầu ghép bảy kỹ sư với ngày trực, ngôn ngữ lập trình, dịch vụ và thành phố dựa trên 22 manh mối. Phép thử sắp xếp yêu cầu đếm cách bố trí 6, 8 và 10 tác vụ triển khai. Không tác vụ nào được ở vị trí cũ, và hai số liên tiếp không được nằm cạnh nhau.

Bài trò chơi đá yêu cầu tìm chiến thuật thắng khi người chơi được lấy 2, 5, 7 hoặc 11 viên nhưng không được lặp lại lượt lấy gần nhất của mình hay đối thủ.

Tác giả ghi lại token đầu vào, token đầu ra, chi phí theo bảng giá và thời gian của từng lần gọi. Token dành cho suy luận được tính như token đầu ra nên cũng nằm trong tổng chi phí. Cách đo này phản ánh môi trường vận hành, nơi hạ tầng trí tuệ nhân tạo phải kiểm soát cả thời gian xử lý và mức tiêu thụ tài nguyên.

Bài lưới logic: Cùng đúng, Opus 5.5 rẻ hơn

Cả hai mô hình điền đúng toàn bộ 28 ô trong bài lưới logic. Theo số liệu The New Stack ghi nhận, Opus 5.5 hoàn thành sau 65 giây với chi phí 0,16 USD, còn Opus 5 cần 108 giây và tốn 0,27 USD.

Opus 5.5 tạo 7.573 token đầu ra, so với 10.621 token của Opus 5. Phiên bản mới vì thế rẻ hơn 43% trong khi vẫn cho cùng đáp án đúng.

The New Stack đánh giá câu trả lời của Opus 5.5 chi tiết hơn đôi chút. Phiên bản này cũng lưu ý rằng nó chưa chứng minh đầy đủ tính duy nhất của nghiệm.

Bài sắp xếp: Cả hai dùng hết ngân sách mà không trả lời

Cả Opus 5.5 và Opus 5 đều không trả lời được bài sắp xếp, kể cả khi ngân sách đầu ra được nâng từ 48.000 lên 128.000 token. Kết quả cho thấy chi phí thấp hơn không đủ tạo ra giá trị nếu mô hình dành nhiều phút suy luận nhưng không trả về nội dung.

The New Stack cho biết đáp án đúng cho ba kích thước bài toán lần lượt là 27, 1.695 và 159.019. Đáp án thứ ba khó đạt được chỉ bằng suy luận. Một chương trình duyệt mọi cách sắp xếp có thể tìm ra kết quả, nhưng hai mô hình không được cấp công cụ chạy mã trong phép thử.

Kết quả ở hai mức giới hạn token

Hình minh họa thời gian và chi phí của hai mô hình Claude
Hai mô hình dùng hết giới hạn suy luận

Với giới hạn 48.000 token đầu ra, cả hai dùng hết ngân sách suy luận mà không trả lời. Theo The New Stack, Opus 5.5 chạy 489 giây và tốn 0,96 USD. Opus 5 chạy 553 giây và tốn 1,20 USD.

Khi giới hạn được nâng lên 128.000 token, Opus 5 sử dụng toàn bộ số token, chạy hơn 25 phút rồi dừng mà không có đáp án. Lần gọi này tốn 3,20 USD.

Opus 5.5 chạy 19 phút và dùng 112.733 token, nhưng giao diện lập trình ứng dụng kết thúc phản hồi bằng lý do từ chối và không trả về nội dung. The New Stack nhận định nguyên nhân nhiều khả năng là bộ lọc an toàn của Anthropic vì câu lệnh chỉ yêu cầu đếm cách sắp xếp và không chứa nội dung nhạy cảm.

Với dạng bài đếm này, cấp công cụ thực thi mã cho mô hình hợp lý hơn việc chờ mô hình tự suy luận. Đây cũng là yếu tố cần tính đến khi triển khai tác tử lập trình bằng trí tuệ nhân tạo cho công việc thực tế.

Trò chơi đá: Opus 5.5 dùng ít token hơn nhiều

Cả hai mô hình trả lời đúng ba phần của bài trò chơi đá, nhưng Opus 5.5 dùng ít hơn 62% token đầu ra và rẻ hơn 69%. Đây là bài kiểm tra cho thấy chênh lệch hiệu quả lớn nhất giữa hai phiên bản mà không có khác biệt về độ chính xác.

Theo The New Stack, người chơi đầu tiên thua khi bắt đầu với 200 viên đá. Có 120 kích thước khởi đầu gây thua trong phạm vi từ 1 đến 500, còn kích thước nhỏ nhất lớn hơn 340 gây thua là 344. Cả hai mô hình đều tìm đúng ba kết quả này.

Opus 5.5 hoàn thành trong 215 giây với 28.740 token đầu ra và chi phí 0,58 USD. Opus 5 mất 624 giây, tạo 74.981 token đầu ra và tốn 1,88 USD, theo số liệu The New Stack ghi nhận.

Kết quả tổng hợp

Trên toàn bộ phép thử, Opus 5.5 dùng 197.046 token đầu ra. Mô hình hoàn thành trong 31 phút 45 giây và tốn 3,95 USD. Opus 5 dùng 261.602 token đầu ra, mất 46 phút 49 giây và tốn 6,55 USD. Hai mô hình vẫn có cùng kết quả về độ chính xác.

Bài kiểm traOpus 5.5Opus 5
Lưới logic28/28, 1 phút 05 giây, 908 token vào, 7.573 token ra, 0,16 USD28/28, 1 phút 48 giây, 906 token vào, 10.621 token ra, 0,27 USD
Sắp xếp, giới hạn 48.000 tokenKhông có đáp án, 8 phút 09 giây, 235 token vào, 48.000 token ra, 0,96 USDKhông có đáp án, 9 phút 13 giây, 233 token vào, 48.000 token ra, 1,20 USD
Sắp xếp, giới hạn 128.000 tokenKhông có đáp án do bị từ chối, 18 phút 56 giây, 235 token vào, 112.733 token ra, 2,26 USDKhông có đáp án, 25 phút 24 giây, 233 token vào, 128.000 token ra, 3,20 USD
Trò chơi đá3/3, 3 phút 35 giây, 323 token vào, 28.740 token ra, 0,58 USD3/3, 10 phút 24 giây, 321 token vào, 74.981 token ra, 1,88 USD
Tổng token1.701 token vào, 197.046 token ra1.693 token vào, 261.602 token ra
Tổng thời gian31 phút 45 giây46 phút 49 giây
Tổng chi phí3,95 USD6,55 USD

Toàn bộ số liệu trong bảng do The New Stack ghi nhận trong lần thử nghiệm Opus 5.5 và Opus 5 được dẫn ở đầu bài.

Chênh lệch tốc độ và chi phí

Hình minh họa chênh lệch tốc độ và chi phí giữa hai phiên bản Claude
Chênh lệch tốc độ và chi phí thử nghiệm

Theo phép tính của The New Stack, Opus 5.5 tạo 103,4 token mỗi giây. Opus 5 đạt 93,1 token mỗi giây. Opus 5.5 nhanh hơn khoảng 11% trên toàn bộ phép thử. Lợi thế tốc độ lớn nhất trong một bài riêng lẻ là 19%, thấp hơn mức trên 30% mà Anthropic công bố.

Mức tiết kiệm lớn nhất xuất hiện ở trò chơi đá. Opus 5.5 tốn 0,58 USD so với 1,88 USD của Opus 5, tương đương mức giảm 69%. Tổng chi phí cho cả hai mô hình trong toàn bộ phép thử là 10,50 USD, theo The New Stack.

Rẻ hơn và nhanh hơn, nhưng chưa suy luận tốt hơn

Ba bài kiểm tra cho thấy Opus 5.5 tiết kiệm chi phí và thời gian so với Opus 5, nhưng không đạt kết quả chính xác hơn. Hai mô hình cùng giải được bài lưới logic và trò chơi đá, đồng thời cùng thất bại ở bài sắp xếp có điều kiện.

The New Stack không chạy lại các bài đánh giá chuẩn mà Anthropic dùng để so sánh Opus 5.5 với Opus 5 về lập trình, công việc tri thức và suy luận. Vì vậy, kết quả này chỉ phản ánh ba bài thử riêng của tác giả, không thay thế các đánh giá chuẩn hoặc một phép so sánh trên nhiều lần chạy.

Lợi ích kinh tế vẫn rõ ràng trong phạm vi thử nghiệm. Opus 5.5 rẻ hơn và hoàn thành sớm hơn trong mọi bài. Theo The New Stack, phần lớn mức tiết kiệm đến từ việc tạo ít token đầu ra hơn. Mức giảm đơn giá giao diện lập trình ứng dụng đóng góp 20%.

Nhóm đang sử dụng Opus 5 có thể cân nhắc chuyển sang Opus 5.5 để giảm chi phí và thời gian chờ. Trong các dạng bài đã được kiểm tra, hai phiên bản cho kết quả tương đương. Tuy nhiên, nhóm vận hành nên đặt giới hạn đầu ra cứng và theo dõi ngân sách. Cả hai mô hình có thể suy luận gần 20 phút hoặc lâu hơn mà không trả về nội dung.

Hãy tiếp tục theo dõi Sine để cập nhật các phép thử mô hình trí tuệ nhân tạo dựa trên chi phí, tốc độ và kết quả thực tế.