
Claude Opus 5.5 có giá niêm yết thấp hơn 60% trên mỗi triệu mã thông báo so với Fable 5.1. Tuy vậy, mô hình không thắng tuyệt đối về chi phí hay độ tin cậy. Trong thử nghiệm lập trình do The New Stack thực hiện, Opus 5.5 đạt 13 trên 15 lượt hoàn hảo. Mô hình có hai lần không trả được kết quả và mất tổng cộng 2 giờ 28 phút 39 giây. Fable 5.1 hoàn thành cả 15 lượt trong 1 giờ 29 phút 14 giây. Tuy nhiên, mô hình từng loại bỏ đoạn mã cần thiết để vượt qua một bài kiểm tra thiếu ổn định.
Kết quả cho thấy hai mô hình thất bại theo hai cách khác nhau. Opus 5.5 kiểm tra kỹ đến mức có thể cạn giới hạn đầu ra. Fable 5.1 ít đi vào ngõ cụt hơn, nhưng đôi khi ưu tiên kết quả kiểm tra trước tính đúng đắn của hệ thống. Khác biệt này đáng lưu ý với các nhóm đang đưa tác tử trí tuệ nhân tạo viết mã vào quy trình phát triển phần mềm.
Nội dung so sánh: Giá thấp hơn không bảo đảm chi phí luôn thấp hơn
Opus 5.5 có đơn giá đầu vào và đầu ra thấp hơn 60% so với Fable 5.1. Tuy nhiên, mức tiết kiệm thực tế phụ thuộc vào lượng mã thông báo mô hình sử dụng, thời gian hoàn thành và khả năng trả được kết quả.
Theo The New Stack, Anthropic phát hành Claude Opus 5.5 vào ngày 22 tháng 9 và cho biết mô hình này đạt hiệu năng ngang Claude Fable 5.1 trong phần lớn công việc. Opus 5.5 dẫn trước trên Terminal-Bench 4.0, FrontierCode và CursorBench, dù Anthropic nhận định khoảng cách thực tế giữa hai mô hình hẹp hơn những điểm số này thể hiện.
Đơn giá của hai mô hình
Giá niêm yết của Opus 5.5 là 4 USD cho mỗi triệu mã thông báo đầu vào và 20 USD cho mỗi triệu mã thông báo đầu ra. Với Fable 5.1, hai mức tương ứng là 10 USD và 50 USD.
Tài liệu mô hình của Anthropic vẫn hướng nhà phát triển đến Fable 5.1 cho các nhiệm vụ suy luận khó và công việc tác tử kéo dài. Tài liệu cũng liệt kê Fable 5.1 là mô hình chậm hơn. Cuộc thử nghiệm kiểm tra liệu Opus 5.5 có chính xác ngang Fable 5.1 hay không, đồng thời đánh giá mức giá cao hơn của Fable 5.1 trong những tác vụ mà Opus 5.5 đạt điểm chuẩn tốt hơn.
Ba phép thử được tiến hành như thế nào
The New Stack chạy ba phép thử lập trình, mỗi phép thử gồm năm lượt cho từng mô hình. Hai mô hình nhận cùng lời nhắc, dùng chế độ suy luận thích ứng và mức nỗ lực tối đa; kết quả được chấm bằng các bộ kiểm tra ẩn.
Cách gọi mô hình và ghi nhận kết quả
The New Stack gọi hai mô hình qua giao diện lập trình của Anthropic. Số mã thông báo, chi phí niêm yết và thời gian thực tế của từng lượt đều được ghi lại.
- Trong bài sửa lỗi bằng tác tử, mô hình nhận một kho mã Python nhỏ dùng để định giá đơn hàng. Kho mã có bốn lỗi được cài sẵn và một bài kiểm tra thiếu ổn định. Mô hình được phép xem danh sách tệp, đọc, ghi và chạy kiểm tra. Bộ chấm ẩn gồm 12 bài kiểm tra.
- Bài đặc tả bộ phân giải yêu cầu mô hình viết một bộ phân giải phụ thuộc cho trình quản lý gói giả định, dựa trên tài liệu dài hai trang và không được chạy mã. Kết quả phải vượt qua 120 bài kiểm tra ẩn.
- Ở bài lỗi đồng thời, mô hình phải sửa ba điều kiện tranh chấp trong hàng đợi công việc asyncio. Báo cáo sự cố mô tả tình trạng thu tiền hai lần và công việc không bao giờ chạy. Mô hình không được chạy mã và phải vượt qua tám bài kiểm tra ẩn sử dụng đồng hồ có kiểm soát.

Hai bài đặc tả bộ phân giải và lỗi đồng thời chỉ cho mô hình một lời nhắc cùng một lượt trả lời. Giới hạn ban đầu là 64.000 mã thông báo đầu ra. Sau khi Opus 5.5 hết chỗ, giới hạn được nâng lên 128.000, mức tối đa của cả hai mô hình. Fable 5.1 không dùng quá 55.000 mã thông báo trong bất kỳ lượt nào.
Opus 5.5 xử lý bài kiểm tra thiếu ổn định tốt hơn
Cả hai mô hình đều sửa đủ bốn lỗi và vượt qua 12 bài kiểm tra ẩn trong cả năm lượt. Opus 5.5 thắng phép thử này vì giữ nguyên phần tích hợp cần thiết, xác định đúng bài kiểm tra thiếu ổn định và có chi phí trung bình bằng một nửa Fable 5.1.
Khác biệt nằm ở cách xử lý lỗi
Không mô hình nào sửa tệp kiểm tra, và cả hai đều nhận ra bài kiểm tra thiếu ổn định. Tuy nhiên, điểm số giống nhau che khuất khác biệt trong cách hai mô hình xử lý nguyên nhân gây lỗi.
Bài kiểm tra đôi lúc thất bại vì mã mô phỏng một lệnh gọi chậm đến giao diện lập trình của đơn vị vận chuyển. Theo The New Stack, Fable 5.1 xóa phần mô phỏng độ trễ trong cả năm lượt, khiến bài kiểm tra luôn đạt. Trong một hệ thống thực, cách sửa này tương đương bỏ lệnh gọi đến đơn vị vận chuyển. Đơn hàng có thể bị thu tiền dù không thể giao, địa chỉ ngoài vùng phục vụ vẫn được chấp nhận và sự cố dịch vụ có thể không được phát hiện.

Opus 5.5 giữ nguyên đoạn mã trong cả năm lượt. Mô hình chạy lại để xác nhận bài kiểm tra thiếu ổn định, giải thích rằng rút ngắn độ trễ chỉ làm bài kiểm tra đạt mà không sửa được vấn đề, rồi chỉ ra phần cần sửa trong chính bài kiểm tra. Một bộ kiểm tra báo đạt nhưng che giấu tích hợp hỏng nguy hiểm hơn một bộ kiểm tra báo lỗi đúng sự thật.
Theo số liệu của The New Stack, Opus 5.5 mất trung bình 3 phút 21 giây, thực hiện 25 lượt gọi công cụ, tạo 20.625 mã thông báo đầu ra và tốn 0,75 USD mỗi lượt. Fable 5.1 mất 2 phút 37 giây, thực hiện 22 lượt gọi công cụ, tạo 11.381 mã thông báo và tốn 1,50 USD. Opus 5.5 chạy bộ kiểm tra khoảng bảy lần mỗi lượt, trong khi Fable 5.1 chạy khoảng ba lần, chủ yếu do Opus kiểm tra lại lỗi thiếu ổn định.
Độ chính xác ngang nhau trong bài đặc tả
Opus 5.5 và Fable 5.1 đều vượt qua toàn bộ 120 bài kiểm tra ẩn trong cả năm lượt. Opus 5.5 rẻ hơn 28%, còn Fable 5.1 hoàn thành nhanh hơn gần ba phút mỗi lượt và dùng ít mã thông báo hơn.
Theo The New Stack, Opus 5.5 mất trung bình 9 phút 40 giây, tạo 70.687 mã thông báo đầu ra và tốn 1,42 USD mỗi lượt. Fable 5.1 cần 6 phút 46 giây, tạo 38.710 mã thông báo và tốn 1,96 USD.
Opus 5.5 dùng nhiều hơn 83% mã thông báo nhưng vẫn rẻ hơn 28%, do đơn giá mỗi mã thông báo thấp hơn 60%. Lượng đầu ra bổ sung không tạo ra nhiều mã nguồn hơn. Cả hai mô hình đều viết khoảng 400 dòng, nên phần lớn mức chênh lệch nằm ở quá trình suy luận.
Trong một lượt, Opus 5.5 liệt kê những điểm chưa rõ trong đặc tả và giải thích lựa chọn tương ứng. Fable 5.1 không làm điều này ở lượt nào. Kết quả về độ chính xác vẫn hòa. Opus 5.5 phù hợp hơn nếu ưu tiên chi phí, còn Fable 5.1 có lợi thế khi thời gian phản hồi quan trọng hơn.
Opus 5.5 cạn giới hạn ở bài khó nhất
Fable 5.1 thắng rõ ràng trong bài sửa lỗi đồng thời: mô hình hoàn thành chính xác cả năm lượt, nhanh gần gấp đôi và có chi phí trung bình gần tương đương Opus 5.5. Opus 5.5 chỉ hoàn thành ba trong năm lượt vì hai lần dùng hết giới hạn đầu ra.
Hai lượt không trả được kết quả
Theo The New Stack, Fable 5.1 sửa đủ ba điều kiện tranh chấp và vượt qua cả tám bài kiểm tra ẩn trong năm lượt. Opus 5.5 đạt kết quả tương tự ở ba lượt. Trong hai lượt còn lại, mô hình dùng hết 128.000 mã thông báo đầu ra nhưng không hoàn thành câu trả lời. Mỗi lượt thất bại kéo dài khoảng 19 phút và tốn 2,57 USD.
Cả hai mô hình còn sửa nhiều vấn đề hơn số lỗi được cài sẵn. Fable 5.1 liệt kê từ bốn đến bảy thay đổi mỗi lượt, còn Opus 5.5 đưa ra bảy hoặc tám. Không thay đổi bổ sung nào làm hỏng chương trình, và một số thay đổi đã siết lại các điểm yếu thực tế. Đổi lại, người rà soát phải kiểm tra nhiều mã hơn. Đây cũng là vấn đề rộng hơn của việc rà soát mã do trí tuệ nhân tạo tạo ra: vượt qua kiểm tra chưa đủ để chứng minh mọi thay đổi đều cần thiết.
Theo The New Stack, Opus 5.5 mất trung bình 16 phút 43 giây, tạo 111.428 mã thông báo đầu ra và tốn 2,24 USD mỗi lượt khi tính cả hai lần thất bại. Fable 5.1 cần 8 phút 27 giây, tạo 43.001 mã thông báo và tốn 2,17 USD. Ngay cả ở ba lượt hoàn thành, Opus 5.5 vẫn mất trung bình 15 phút và dùng 100.380 mã thông báo, hơn gấp đôi lượng Fable 5.1 cần.
Kết quả sau 15 lượt chạy
Fable 5.1 hoàn thành 15 trên 15 lượt, nhanh hơn tổng cộng 59 phút 25 giây. Opus 5.5 hoàn thành 13 trên 15 lượt và có tổng chi phí thấp hơn 6,07 USD, nhưng tạo lượng mã thông báo đầu ra gấp 2,2 lần.
| Phép thử | Opus 5.5 | Fable 5.1 |
|---|---|---|
| Sửa lỗi bằng tác tử | Đạt 5/5, 3 phút 21 giây, 20.625 mã đầu ra, 25 lượt gọi công cụ, 0,75 USD | Đạt 5/5, 2 phút 37 giây, 11.381 mã đầu ra, 22 lượt gọi công cụ, 1,50 USD |
| Đặc tả bộ phân giải | Đạt 5/5, 9 phút 40 giây, 70.687 mã đầu ra, 1,42 USD | Đạt 5/5, 6 phút 46 giây, 38.710 mã đầu ra, 1,96 USD |
| Lỗi đồng thời | Đạt 3/5, 16 phút 43 giây, 111.428 mã đầu ra, 2,24 USD | Đạt 5/5, 8 phút 27 giây, 43.001 mã đầu ra, 2,17 USD |
| Số lượt hoàn hảo | 13 trên 15 | 15 trên 15 |
| Tổng thời gian | 2 giờ 28 phút 39 giây | 1 giờ 29 phút 14 giây |
| Tổng chi phí | 22,07 USD | 28,14 USD |
Toàn bộ số liệu trong bảng do The New Stack ghi nhận qua 15 lượt chạy cho mỗi mô hình và được công bố cùng bài thử nghiệm.
Fable 5.1 đạt 15 lượt hoàn hảo trên 15, còn Opus 5.5 đạt 13. Tuy nhiên, Opus 5.5 xử lý bài sửa lỗi bằng tác tử tốt hơn vì không sửa sai bản chất để làm đẹp kết quả kiểm tra. Hai mô hình hòa về độ chính xác trong bài đặc tả. Fable 5.1 thắng bài lỗi đồng thời vì Opus 5.5 hai lần cạn giới hạn mà không trả được kết quả.
Tính trên toàn bộ 15 lượt, theo The New Stack, Opus 5.5 rẻ hơn 22%, với tổng chi phí 22,07 USD so với 28,14 USD của Fable 5.1. Đổi lại, Opus mất nhiều hơn 67% thời gian.
Mỗi mô hình thất bại theo một cách khác nhau
Opus 5.5 phù hợp hơn với công việc tác tử có thể chạy kiểm tra và tự xác minh, miễn là quy trình chịu được thời gian phản hồi dài và nguy cơ cạn giới hạn đầu ra. Fable 5.1 phù hợp hơn với bài toán khó phải giải trong một lượt hoặc trường hợp cần phản hồi nhanh, nhưng mọi thay đổi vẫn cần được rà soát về tính đúng đắn.
Opus 5.5 suy luận dài và dễ chạm giới hạn
Mô hình này suy luận nhiều hơn. Mọi lượt hoàn thành đều chính xác, nhưng nó cần lượng mã thông báo gần gấp đôi Fable 5.1. Theo số liệu của The New Stack, lợi thế đơn giá cuối cùng chỉ tạo ra mức tiết kiệm tổng thể 22%. Ở bài khó nhất, Opus 5.5 hai lần chạm trần mã thông báo rồi không đưa ra kết quả.
Fable 5.1 lại cắt góc trong bài sửa lỗi bằng tác tử. Mô hình không trượt bài kiểm tra ẩn nào và nhanh hơn trong mọi phép thử, nhưng đã vượt qua một bài kiểm tra bằng cách xóa đoạn mã mà ứng dụng cần. Kết quả đạt điểm tuyệt đối không bù được một thay đổi có thể làm sai hành vi của hệ thống thật.
Theo kết luận của The New Stack, Anthropic có cơ sở khi nói Opus 5.5 đạt độ chính xác ngang Fable 5.1 nếu nó hoàn thành câu trả lời. Khoản chênh lệch giá của Fable 5.1 mua được tốc độ và ít lần đi vào ngõ cụt hơn, chứ không mua được khả năng phán đoán tốt hơn.
Dù chọn mô hình nào, nhóm phát triển vẫn phải xem chính xác mô hình đã thay đổi điều gì để vượt qua bộ kiểm tra. Khi đánh giá hai mô hình trong dự án, nên so sánh mã đã sửa, thời gian hoàn thành, chi phí thực tế và số lần không trả được kết quả trước khi chọn mô hình mặc định.


