Claude và ChatGPT: tốc độ hay giải thích chi tiết?

Claude và ChatGPT cùng đạt độ chính xác tối đa trong ba phép thử. ChatGPT nhanh hơn và dùng ít token hơn, còn Claude giải thích kỹ các quyết định kỹ thuật.

Người dùng làm việc trên máy tính
Ảnh minh họa cho bài so sánh hai công cụ AI.

Claude và ChatGPT đạt độ chính xác ngang nhau trong ba phép thử công việc, nhưng ChatGPT hoàn thành nhanh hơn và tạo ít token đầu ra hơn. Hệ thống của Anthropic chậm hơn nhưng giải thích rõ hơn về tài liệu API, quy tắc làm tròn và phương pháp tính phân vị. Vì vậy, lựa chọn phù hợp phụ thuộc vào việc người dùng ưu tiên tốc độ hay khả năng kiểm tra cách hệ thống đi đến kết quả.

Anthropic đã hợp nhất phần trò chuyện Claude và Cowork vào một giao diện, cho phép người dùng đặt câu hỏi rồi giao một nhiệm vụ nhiều bước trong cùng cuộc hội thoại. Hệ thống tự quyết định cách xử lý thay vì buộc người dùng chọn chế độ. Trải nghiệm này được triển khai trước cho thuê bao Pro và Max, sau đó mới đến các gói miễn phí và nhóm.

OpenAI áp dụng cách tiếp cận tương tự từ ngày 9 tháng 7, khi bổ sung chế độ Làm việc bên cạnh phần trò chuyện. Một tháng sau, hãng dần loại bỏ chế độ Tác tử riêng biệt trước đó. Chế độ Làm việc cung cấp môi trường tách biệt có trình duyệt, khả năng thực thi mã và xuất tệp. Tuy nhiên, chế độ này chưa thể trao lại một phiên trình duyệt đang đăng nhập cho người dùng giữa chừng để xử lý đăng nhập hoặc thanh toán.

Theo phép so sánh của The New Stack, OpenAI xây dựng chế độ Làm việc trên tác tử lập trình Codex sau khi công bố khoảng một phần năm trong số 5 triệu người dùng Codex hằng tuần không phải là lập trình viên. Nhóm này tăng nhanh gấp ba lần nhóm lập trình viên. Khi hai sản phẩm ngày càng giống nhau về tính năng, độ chính xác, tốc độ, độ tin cậy và lượng token trở thành những điểm phân biệt chính.

Ba phép thử mô phỏng công việc thực tế của lập trình viên: nghiên cứu tài liệu API, viết công cụ từ đặc tả và chuyển từ câu hỏi ngắn sang phân tích tệp. Cách đánh giá này cũng phản ánh câu hỏi rộng hơn về cách tác tử AI hỗ trợ lập trình khi nhiệm vụ không dừng ở việc tạo mã.

Ba phép thử được thực hiện như thế nào

The New Stack đánh giá Claude và ChatGPT bằng ba nhiệm vụ có kết quả kiểm chứng được. Hai hệ thống phải nghiên cứu bốn API, viết một công cụ theo đặc tả và phân tích tệp nhật ký. Cùng một yêu cầu được dùng cho cả hai để so sánh độ chính xác, thời gian hoàn thành và lượng token.

Nghiên cứu tài liệu API

Phép thử thứ nhất yêu cầu tra cứu bốn API dành cho lập trình viên gồm GitHub REST API, Stripe API, Twilio Messaging API và OpenAI API. Mỗi công cụ phải lập bảng về giới hạn tốc độ đối với yêu cầu đã xác thực, sự tồn tại của gói miễn phí và phiên bản hoặc ngày phiên bản hiện hành trong tài liệu. Tác giả kiểm tra lại câu trả lời với tài liệu của từng nhà cung cấp trong cùng ngày.

Người dùng làm việc trên máy tính
Ảnh minh họa người dùng làm việc với phần mềm.

Ở phép thử thứ hai, hai công cụ phải viết một trình phân tích thời lượng chạy bằng dòng lệnh theo đặc tả chặt chẽ. Tệp kết quả mang tên durparse.py, hỗ trợ đơn vị ngày, giờ, phút và giây theo thứ tự từ lớn đến nhỏ. Mỗi đơn vị chỉ được xuất hiện một lần, số thập phân được chấp nhận, số không kèm đơn vị được hiểu là giây và mọi đầu vào khác phải trả về None.

Phép thử cuối bắt đầu bằng một câu hỏi về hai dấu vết lỗi để xác định trường hợp nào cho thấy điều kiện tranh chấp. Sau đó, trong cùng cuộc hội thoại, mỗi hệ thống nhận nhiệm vụ lấy tệp api_logs.csv từ Google Drive, tính các phân vị độ trễ và tỷ lệ lỗi theo từng điểm cuối, rồi tạo bảng tính có biểu đồ. Tác giả tự tạo dữ liệu nhật ký nên biết trước toàn bộ kết quả đúng.

Nghiên cứu API: cùng chính xác, Claude thêm ngữ cảnh

Claude và ChatGPT đều trả lời đúng 12 trên 12 trường trong phép thử nghiên cứu API. ChatGPT hoàn thành nhanh hơn và tạo ít token hơn. Công cụ của Anthropic dành thêm thời gian để đọc nhiều trang, liệt kê nguồn và bổ sung các giới hạn hoặc điều kiện liên quan trực tiếp đến từng API.

Phần trả lời của Claude bổ sung giới hạn riêng của GitHub dành cho token Actions, khoảng thời gian xếp hàng của Twilio và các ngưỡng cấp sử dụng của OpenAI. Công cụ này cũng ghi chú rằng có một trang không thể truy cập.

Theo số liệu The New Stack ghi lại, ChatGPT hoàn thành sau 1 phút 17 giây và tạo 649 token đầu ra. Claude cần 1 phút 44 giây, tạo 1.042 token đầu ra, đọc tám trang, liệt kê chín nguồn và đề nghị xuất bảng thành bảng tính. Claude mất thêm 27 giây và tạo nhiều hơn 393 token, đổi lại là phần ngữ cảnh chi tiết hơn.

Viết từ đặc tả: cả hai vượt qua 16 phép kiểm tra

Claude và ChatGPT đều tạo được tệp đáp ứng đầy đủ đặc tả và vượt qua 16 trường hợp kiểm tra ẩn. ChatGPT hoàn thành nhanh hơn và dùng ít token đầu ra hơn. Claude giải thích thêm một quyết định kỹ thuật mà đặc tả chưa xác định, giúp người dùng thấy cách công cụ xử lý điểm mơ hồ.

Kết quả kiểm tra tệp mã

Đặc tả dài 517 token được gửi giống nhau cho cả hai hệ thống. Tệp durparse.py do Claude và ChatGPT tạo ra đều vượt qua đủ 16 trường hợp kiểm tra ẩn, bao gồm các bẫy về đơn vị sai thứ tự, đơn vị lặp lại, số đứng cuối không có đơn vị và giá trị âm.

Theo The New Stack, ChatGPT hoàn thành trong 1 phút 17 giây với 769 token đầu ra. Claude mất 1 phút 45 giây và dùng 989 token đầu ra. Claude cho biết đã tự chạy 35 trường hợp kiểm tra trước khi trả tệp. Cả hai đều cung cấp tệp tải xuống và hiển thị toàn bộ mã trong câu trả lời.

Người dùng làm việc trên máy tính
Ảnh minh họa cho phần đánh giá công cụ AI.

Mã nguồn của hai bên gần như giống nhau, cùng dùng phép tính có độ chính xác tuyệt đối và biểu thức chính quy với thứ tự cố định. Điểm khác biệt nằm ở phần giải thích. Claude nêu rõ rằng làm tròn 0,5 giây lên là một quy ước chưa được đặc tả, trong khi hàm làm tròn mặc định của Python có thể cho kết quả theo hướng khác. ChatGPT chỉ thông báo rằng các phép kiểm tra đã đạt.

Kết quả này cho thấy mã chạy đúng chưa giải thích được hệ thống đã xử lý các điểm mơ hồ ra sao. Đây cũng là vấn đề được nêu trong bài về xác minh 2.000 yêu cầu hợp nhất mỗi tháng.

Chuyển giao nhiệm vụ: ChatGPT nhanh hơn rõ rệt

Cả hai hệ thống đều chuyển từ một câu hỏi ngắn sang nhiệm vụ phân tích tệp mà người dùng không phải đổi chế độ. Hai bên xác định đúng lỗi và tạo đúng 30 trên 30 kết quả trong bảng tính. ChatGPT hoàn thành phần phân tích nhanh hơn, còn Claude mô tả phương pháp tính phân vị.

Ở câu hỏi mở đầu dài 135 token, cả hai đều xác định đúng dấu vết B, nơi kích thước từ điển thay đổi trong lúc lặp. ChatGPT trả lời bằng 48 token trong khoảng 10 giây. Claude dùng 118 token và khoảng 25 giây, đồng thời lưu ý lỗi tương tự vẫn có thể xảy ra khi không có nhiều luồng nếu chính phần thân vòng lặp sửa từ điển.

Sau đó, hai hệ thống nhận nhiệm vụ phân tích nhật ký mà không cần chuyển chế độ thủ công. Claude lấy tệp, tính bảng và tạo tệp bảng tính có biểu đồ cột về độ trễ p95 trong khoảng 4 phút, với 319 token đầu ra. ChatGPT tạo cùng loại bảng tính và biểu đồ trong 28 giây hoạt động, dùng 467 token đầu ra.

Theo dữ liệu gốc do tác giả The New Stack tạo, cả hai hệ thống đều khớp đủ 30 trên 30 con số. Claude nói rõ đã dùng phương pháp nội suy tuyến tính để tính phân vị và cho biết kết quả sẽ trùng nếu tính lại trong Google Sheets. ChatGPT đưa ra bảng đúng nhưng không giải thích phương pháp ở mức tương tự.

Kết quả tổng hợp

Claude và ChatGPT hòa nhau về độ chính xác trong toàn bộ tiêu chí được chấm. ChatGPT nhanh hơn ở từng nhiệm vụ và tạo tổng cộng 1.933 token đầu ra hiển thị, so với 2.468 token của Claude. Claude dùng nhiều token hơn nhưng cung cấp thêm thông tin phục vụ việc kiểm tra kết quả.

Phép thửChatGPT ở chế độ Làm việcClaude trong ứng dụng hợp nhất
Nghiên cứu API12/12, 1 phút 17 giây, 125 token vào, 649 token ra12/12, 1 phút 44 giây, 125 token vào, 1.042 token ra
Viết từ đặc tả16/16, 1 phút 17 giây, 517 token vào, 769 token ra16/16, 1 phút 45 giây, 517 token vào, 989 token ra
Câu hỏi chuyển giaoĐúng, khoảng 10 giây, 135 token vào, 48 token raĐúng, khoảng 25 giây, 135 token vào, 118 token ra
Nhiệm vụ chuyển giao30/30, 28 giây hoạt động, 133 token vào, 467 token ra30/30, khoảng 4 phút, 133 token vào, 319 token ra
Tổng token hiển thị910 token vào, 1.933 token ra910 token vào, 2.468 token ra

Nguồn số liệu: phép thử của The New Stack, được đối chiếu với tài liệu nhà cung cấp và dữ liệu gốc trong ngày thực hiện.

Mọi trường dữ liệu, trường hợp kiểm tra và kết quả số đều khớp, đồng thời cả hai hệ thống đều trích dẫn tài liệu có thật. Theo phép thử của The New Stack, ChatGPT dùng ít hơn 535 token đầu ra so với Claude.

Nội dung giải thích khác nhau ra sao

Phần Claude viết thêm gồm bối cảnh API, lựa chọn làm tròn chưa được đặc tả và phương pháp tính phân vị. Những chi tiết này giúp người dùng kiểm tra kết quả thay vì chỉ nhận một câu trả lời đúng.

Nên chọn ChatGPT hay Claude cho công việc nhiều bước?

ChatGPT phù hợp hơn khi tốc độ và lượng token đầu ra là tiêu chí chính. Claude phù hợp hơn khi người dùng cần xem các giả định và quyết định kỹ thuật đứng sau kết quả. Trong phép thử này, lựa chọn giữa hai hệ thống không dựa trên độ chính xác vì cả hai đạt điểm bằng nhau.

Chênh lệch ở hai nhiệm vụ ngắn là 27 và 28 giây, đều nghiêng về ChatGPT. Với nhiệm vụ phân tích tệp, ChatGPT hoàn thành trong 28 giây hoạt động, còn Claude cần khoảng 4 phút.

Claude giải thích phần tài liệu bổ sung, nêu điểm mơ hồ trong quy tắc làm tròn và ghi rõ phương pháp tính phân vị. Cách trình bày này có giá trị khi câu trả lời cần được rà soát, nhất là trong bối cảnh AI đang thay đổi quy trình rà soát mã.

Kết quả không cho thấy Claude chính xác hơn. ChatGPT thắng về tốc độ và lượng token đầu ra, còn Claude cung cấp nhiều thông tin giải thích hơn. Tác giả thử nghiệm chọn Claude vì đánh giá phần ngữ cảnh bổ sung quan trọng hơn thời gian chờ.

Câu hỏi thường gặp

Claude hay ChatGPT chính xác hơn trong các phép thử?

Hai hệ thống có độ chính xác ngang nhau trong phạm vi thử nghiệm. Claude và ChatGPT đều đạt 12 trên 12 trường nghiên cứu API, vượt qua 16 trên 16 phép kiểm tra mã và khớp 30 trên 30 kết quả khi phân tích tệp nhật ký.

Claude hay ChatGPT hoàn thành công việc nhanh hơn?

ChatGPT nhanh hơn trong tất cả nhiệm vụ được đo. Công cụ hoàn thành hai phép thử đầu trong 1 phút 17 giây mỗi phép và xử lý nhiệm vụ phân tích tệp trong 28 giây hoạt động. Claude lần lượt cần 1 phút 44 giây, 1 phút 45 giây và khoảng 4 phút.

Vì sao Claude dùng nhiều token hơn ChatGPT?

Claude tạo 2.468 token đầu ra hiển thị, còn ChatGPT tạo 1.933 token. Phần chênh lệch đi kèm với các giải thích về giới hạn API, quy tắc làm tròn và phương pháp tính phân vị. Phép thử không xác định toàn bộ lượng token nội bộ mà hai hệ thống sử dụng.

Claude phù hợp với loại công việc nào?

Kết quả thử nghiệm cho thấy Claude phù hợp với công việc cần giải thích giả định và phương pháp để người dùng rà soát. Đây không phải bằng chứng Claude chính xác hơn ChatGPT, mà là khác biệt về mức độ trình bày trong ba nhiệm vụ đã đo.

Hãy theo dõi Sine để đọc thêm các phép thử AI được trình bày bằng số liệu và đặt trong bối cảnh sử dụng thực tế.