GPT-6 Sol và Claude Opus 5.5: Rẻ có đáng đổi?

GPT-6 Sol rẻ và nhanh hơn, nhưng Claude Opus 5.5 đạt kết quả hoàn hảo trong cả 15 lượt thử của The New Stack. Lựa chọn phù hợp phụ thuộc vào khả năng kiểm tra đầu ra và chi phí của một lần sai.

Hình minh họa phép so sánh GPT-6 Sol và Claude Opus 5.5
Chi phí thấp cần đi cùng kết quả ổn định.

GPT-6 Sol có lợi thế về chi phí và tốc độ, còn Claude Opus 5.5 ổn định hơn trong các bài kiểm tra khó. Theo thử nghiệm GPT-6 Sol và Claude Opus 5.5 của The New Stack, Opus 5.5 hoàn thành hoàn hảo cả 15 lượt chạy. The New Stack ghi tổng số của Sol là 12 lượt hoàn hảo, nhưng các kết quả chi tiết 5/5, 2/5 và 4/5 cộng lại thành 11/15. Bài viết này dùng tổng số 11/15 theo dữ liệu chi tiết, tương ứng với bốn lượt thất bại. Sol phù hợp hơn khi con người hoặc bộ kiểm thử có thể kiểm tra đầu ra. Opus 5.5 đáng cân nhắc hơn khi một lỗi nhỏ có thể gây thiệt hại và kết quả được sử dụng trực tiếp.

OpenAI ra mắt GPT-6 Sol vào ngày 22 tháng 9. Công ty tuyên bố mô hình đạt điểm cao hơn Claude Opus 5 trong các quy trình nghiệp vụ với chi phí cho mỗi tác vụ chỉ bằng 9%. OpenAI công bố Sol đạt 33,2% trên AutomationBench của Zapier, so với 26,9% của Opus 5. Anthropic phát hành Opus 5.5 cùng ngày. Vì vậy, The New Stack dùng phiên bản mới hơn này để đối chiếu.

Theo mức giá công bố được The New Stack dẫn lại, Sol có giá 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra. Opus 5.5 có giá tương ứng là 4 USD và 20 USD. Sol vì thế có thể dùng nhiều token hơn mà tổng chi phí vẫn thấp hơn, nhưng chi phí thực tế còn phụ thuộc vào lượng token mỗi mô hình tạo ra.

Cách GPT-6 Sol và Claude Opus 5.5 được kiểm tra cùng nội dung đánh giá

The New Stack kiểm tra hai mô hình bằng ba nhiệm vụ, sau đó lặp lại mỗi nhiệm vụ năm lần để đo độ ổn định. Cả hai đều đạt điểm tuyệt đối khi chỉ chạy một lần. Khác biệt xuất hiện khi các bài phân tích nhật ký và viết mã được lặp lại.

Ba nhiệm vụ dùng trong phép thử

Ở vòng đầu tiên, cả hai mô hình đều sửa được ba lỗi được cài sẵn trong một dịch vụ thanh toán viết bằng Python. Chúng cũng phân loại đúng 40 tác vụ tích hợp liên tục thất bại và trả lời 20 câu hỏi về một bộ công cụ phát triển giả định mà không bịa ra phương thức nào. Hai bài khó hơn gồm báo cáo sự cố dài 3.664 dòng và một phần triển khai đặc tả được chấm bằng 120 phép thử ẩn. Cả hai vẫn đạt điểm tuyệt đối khi mỗi bài chỉ được thực hiện một lần.

Cách đo tính nhất quán

Vì kết quả đơn lẻ không tạo ra khác biệt, The New Stack chuyển phép so sánh sang tính nhất quán. Hai mô hình nhận cùng câu lệnh qua giao diện lập trình ứng dụng và chạy ở mức nỗ lực cao nhất mà mỗi bên cung cấp. Mỗi bài được lặp lại năm lần. Cách làm này phản ánh việc triển khai tác tử AI viết mã, nơi một kết quả đúng chưa chứng minh hệ thống có thể lặp lại chất lượng đó.

Tiêu chí của từng nhiệm vụ

  • Phân loại lỗi tích hợp liên tục, mô hình đọc nhật ký của 40 tác vụ thất bại cùng tài liệu chứa các quy tắc điều kiện. Sau đó, mô hình quyết định thử lại, chặn hay báo động cho từng trường hợp. Theo The New Stack, đây là bài gần nhất với tuyên bố AutomationBench của OpenAI. AutomationBench đánh giá tác tử trong quy trình đầu cuối dùng 47 công cụ, còn phép thử này chỉ dùng một lần gọi.
  • Phân tích nhật ký sự cố yêu cầu đọc 3.664 dòng từ năm dịch vụ trong một sự cố kéo dài hai giờ. Mô hình phải trả lời bảy câu hỏi hậu kiểm. The New Stack cho biết nhiệm vụ này đòi hỏi đếm chính xác, chuyển đổi múi giờ và nhận ra một chi tiết đánh lạc hướng.
  • Triển khai bộ phân giải phụ thuộc giao cho mô hình một đặc tả dài hai trang về trình quản lý gói giả định. Mô hình phải viết bộ phân giải mà không được chạy mã, sau đó kết quả được chấm bằng 120 phép thử ẩn.

The New Stack ghi lại token, chi phí theo bảng giá và thời gian của từng lượt gọi. Việc lặp lại làm rõ một vấn đề thường xuất hiện khi AI tham gia rà soát mã: đầu ra có vẻ hợp lý không có nghĩa là nó sẽ đúng đều qua nhiều lần chạy.

Kết quả phân loại lỗi tích hợp liên tục

Độ chính xác, tốc độ và chi phí

Cả hai mô hình xử lý đúng toàn bộ 40 tác vụ trong cả năm lượt. GPT-6 Sol hoàn thành bài kiểm tra nhanh hơn và có chi phí mỗi lượt bằng 8% Claude Opus 5.5, gần với mức 9% mà OpenAI công bố cho AutomationBench.

Theo kết quả của The New Stack, Opus 5.5 mất trung bình 1 phút 27 giây, tạo 11.127 token đầu ra và tốn 0,24 USD mỗi lượt. Sol mất 18 giây, tạo 1.143 token đầu ra và tốn 0,02 USD. Cả hai đều đạt 5 trên 5 lượt hoàn hảo.

The New Stack cũng nhận thấy Opus 5.5 dùng số token đầu ra gần gấp bốn lần Opus 5 khi cùng bài kiểm tra từng được thực hiện với phiên bản trước. Do đó, giá niêm yết theo token không tự quyết định hóa đơn cuối cùng. Lượng token mô hình sử dụng trong từng nhiệm vụ cũng ảnh hưởng trực tiếp đến chi phí.

Kết quả phân tích nhật ký sự cố

Sai sót trong ba lượt của Sol

Claude Opus 5.5 hoàn thành chính xác cả năm lượt phân tích nhật ký, còn GPT-6 Sol chỉ hoàn hảo hai lượt. Ba lỗi của Sol đều liên quan đến độ chính xác chi tiết, gồm hai lần bỏ sót cùng một khách hàng và một lần đếm thiếu giao dịch thất bại.

Theo The New Stack, trong hai lượt thất bại, Sol bỏ sót cùng một khách hàng có khoản phí ban đầu được xác nhận sau khi lần thử lại đã thành công 52 giây. Ở lượt còn lại, Sol đếm 27 giao dịch thanh toán thất bại thay vì 28.

Sol vẫn nhanh hơn, rẻ hơn và dùng ít token hơn. Số liệu của The New Stack cho thấy Opus 5.5 mất trung bình 6 phút 44 giây, tạo 53.308 token đầu ra và tốn 1,68 USD mỗi lượt. Sol mất 1 phút 41 giây, tạo 7.073 token đầu ra và tốn 0,30 USD. Sol đọc cùng tệp nhật ký với 113.966 token đầu vào, so với 152.345 token của Opus 5.5.

Một khách hàng bị bỏ khỏi danh sách hoàn tiền có thể khó bị phát hiện hơn một câu trả lời sai rõ ràng. Kết quả này cho thấy xác minh đầu ra ở quy mô lớn cần được tính vào quy trình, thay vì chỉ so sánh chi phí của mỗi lần gọi mô hình.

Kết quả triển khai bộ phân giải phụ thuộc

Một lỗi làm hỏng toàn bộ lượt chạy

Claude Opus 5.5 vượt qua toàn bộ 120 phép thử trong cả năm lượt. GPT-6 Sol đạt kết quả hoàn hảo ở bốn lượt. Trong lượt còn lại, một dấu ngoặc thừa khiến mô đun không thể nhập và thất bại toàn bộ bộ kiểm thử.

Opus 5.5 mất trung bình 9 phút 40 giây, tạo 70.687 token đầu ra và tốn 1,42 USD mỗi lượt. Sol mất 6 phút 28 giây, tạo 21.435 token đầu ra và tốn 0,22 USD, theo phép đo của The New Stack.

Hình minh họa kết quả kiểm thử hai mô hình AI
Kết quả được đối chiếu qua nhiều lượt chạy.

Sol tiếp tục có lợi thế về tốc độ và chi phí, nhưng lỗi ở dòng 78 khiến toàn bộ kết quả của một lượt chạy không thể sử dụng. Bài kiểm tra này phân biệt rõ chi phí tạo mã với chi phí để nhận được mã chạy đúng.

Kết quả tổng hợp sau 15 lượt chạy

Claude Opus 5.5 đạt 15 trên 15 lượt hoàn hảo với tổng chi phí 16,72 USD. Các hàng kết quả chi tiết cho thấy GPT-6 Sol đạt 11 trên 15 lượt hoàn hảo với tổng chi phí 2,68 USD, dù phần tổng hợp của The New Stack ghi 12 trên 15. Sol có bốn lượt thất bại ở hai nhiệm vụ khó nhất, nơi kết quả phụ thuộc vào việc đếm chính xác hoặc tạo mã chạy được ngay.

Bảng kết quả và chi phí

Bài kiểm traClaude Opus 5.5GPT-6 Sol
Phân loại lỗi tích hợp liên tục5/5 hoàn hảo, 1 phút 27 giây, 5.447 token vào, 11.127 token ra, 0,24 USD5/5 hoàn hảo, 18 giây, 3.867 token vào, 1.143 token ra, 0,02 USD
Phân tích nhật ký sự cố5/5 hoàn hảo, 6 phút 44 giây, 152.345 token vào, 53.308 token ra, 1,68 USD2/5 hoàn hảo, 1 phút 41 giây, 113.966 token vào, 7.073 token ra, 0,30 USD
Triển khai bộ phân giải phụ thuộc5/5 hoàn hảo, 9 phút 40 giây, 2.430 token vào, 70.687 token ra, 1,42 USD4/5 hoàn hảo, 6 phút 28 giây, 1.687 token vào, 21.435 token ra, 0,22 USD
Tổng số lượt hoàn hảo15/1511/15 theo các hàng chi tiết
Tổng chi phí cho 15 lượt16,72 USD2,68 USD

Các số liệu theo từng bài do The New Stack ghi nhận trong 15 lượt chạy. Tổng 11/15 của Sol được cộng từ 5/5, 2/5 và 4/5; phần tổng hợp của nguồn ghi 12/15.

Hình minh họa chi phí và độ ổn định của hai mô hình
Chi phí thấp được cân cùng độ ổn định.

Chênh lệch tổng chi phí và độ ổn định

Tổng chi phí 2,68 USD của Sol bằng khoảng 16% mức 16,72 USD của Opus 5.5. Trong bài phân loại lỗi tích hợp liên tục, Sol nhanh gần gấp năm lần. Theo The New Stack, mô hình chỉ tốn 8% chi phí của Opus 5.5 trong bài này. Đổi lại, Opus 5.5 không có lượt thất bại nào trong ba bài kiểm tra được lặp lại.

Rẻ hơn có đáng giá khi kết quả thiếu ổn định?

GPT-6 Sol đáng giá khi tổ chức có thể kiểm tra, chạy lại hoặc loại bỏ đầu ra sai. Claude Opus 5.5 hợp lý hơn khi kết quả được sử dụng trực tiếp và một lỗi nhỏ có thể gây tổn thất lớn. Tiêu chí quyết định không chỉ là giá mỗi token, mà còn là chi phí phát hiện và xử lý một lần sai.

Độ ổn định qua nhiều lượt chạy

Kết quả không cho thấy Sol yếu ở mọi tác vụ. Khi chỉ xét một lần chạy, hai mô hình hòa nhau trong tất cả bài kiểm tra. Khác biệt chỉ xuất hiện sau khi từng bài được chạy năm lần. Opus 5.5 duy trì kết quả, còn Sol có bốn lượt sai theo dữ liệu chi tiết: ba lượt ở bài phân tích nhật ký và một lượt ở bài triển khai bộ phân giải.

Sol phù hợp hơn với khối lượng công việc lớn khi con người hoặc bộ kiểm thử luôn kiểm tra đầu ra. Các trường hợp phù hợp gồm phân loại tác vụ, soạn bản nháp và viết mã phải đi qua quy trình tích hợp liên tục. Với mức chi phí ghi nhận trong thử nghiệm, nhóm phát triển có thể chạy Sol hai lần rồi so sánh kết quả. Cách dùng này tận dụng lợi thế về giá và tốc độ mà không coi đầu ra đầu tiên là đáp án cuối cùng.

Khi sai sót gây tổn thất lớn

Opus 5.5 hợp lý hơn khi câu trả lời sai gây tổn thất lớn và không có lớp kiểm tra phía sau. Đối soát tài chính hoặc báo cáo sự cố gửi thẳng cho khách hàng là hai trường hợp được The New Stack nêu ra. Trong những quy trình này, khoản tiết kiệm ở lần gọi mô hình có thể không bù được chi phí xử lý một khách hàng bị bỏ sót hoặc một báo cáo sai.

Đối với doanh nghiệp trong nước, việc chọn mô hình nên bắt đầu từ cách đầu ra được kiểm soát. Sol đem lại mức tiết kiệm đáng kể nếu tổ chức đã có kiểm thử tự động, quy trình duyệt và khả năng chạy lại. Nếu mô hình được trao nhiều quyền trong hệ thống, tổ chức cần giải quyết câu hỏi về giới hạn quyền của AI. Việc này nên hoàn tất trước khi tối ưu hóa chi phí.

Câu hỏi thường gặp

GPT-6 Sol hay Claude Opus 5.5 rẻ hơn?

GPT-6 Sol rẻ hơn trong thử nghiệm của The New Stack. Tổng chi phí cho 15 lượt là 2,68 USD với Sol và 16,72 USD với Opus 5.5. Mức chênh lệch thực tế còn phụ thuộc vào số token mà mỗi mô hình sử dụng cho từng nhiệm vụ.

Mô hình nào ổn định hơn trong các nhiệm vụ khó?

Claude Opus 5.5 ổn định hơn trong phép thử được lặp lại. Mô hình hoàn thành hoàn hảo cả 15 lượt, còn dữ liệu chi tiết cho thấy GPT-6 Sol hoàn hảo ở 11 lượt. Bốn lượt thất bại của Sol gồm ba lượt phân tích nhật ký và một lượt triển khai bộ phân giải phụ thuộc.

Khi nào nên chọn GPT-6 Sol?

GPT-6 Sol phù hợp khi đầu ra được con người, bộ kiểm thử hoặc quy trình duyệt kiểm tra trước khi sử dụng. Lợi thế về tốc độ và chi phí có giá trị nhất với khối lượng công việc lớn, nơi tổ chức có thể chạy lại tác vụ hoặc loại bỏ kết quả sai.

Khi nào nên chọn Claude Opus 5.5?

Claude Opus 5.5 phù hợp hơn khi đầu ra được sử dụng trực tiếp và lỗi có thể gây tổn thất lớn. Trong thử nghiệm của The New Stack, Opus 5.5 duy trì kết quả hoàn hảo qua cả 15 lượt, kể cả các nhiệm vụ yêu cầu đếm chính xác và tạo mã chạy được.

Hãy đối chiếu chi phí mỗi lượt với chi phí của một lần sai trước khi chọn mô hình cho quy trình của bạn.