Grok Build có bộ nhớ tốt hơn Claude Code nếu tiêu chí chính là duy trì quy tắc giữa nhiều dự án. Trong bài thử nghiệm gốc của The New Stack, Grok Build đạt 3 trên 3 bài thử, còn Claude Code đạt 2 trên 3 vì không áp dụng được quy tắc về thông điệp cam kết sang kho mã thứ hai.
Claude Code nhanh hơn trong cả ba phiên nhớ lại, với tổng thời gian 66 giây so với 165 giây của Grok. Tuy nhiên, The New Stack ghi nhận Claude dùng 576.863 token và tốn 1,05 USD, trong khi Grok dùng 390.848 token với chi phí 0,41 USD. Kết quả này chỉ phản ánh ba tình huống trên bốn kho mã Node nhỏ và không đại diện cho mọi dự án.
Bộ nhớ của hai công cụ hoạt động ra sao?
Grok Build và Claude Code đều lưu dữ kiện từ phiên làm việc vào tệp Markdown để đọc lại sau. Khác biệt chính là phạm vi lưu trữ: Grok Build có cả bộ nhớ theo không gian làm việc và bộ nhớ toàn cục, còn bộ nhớ tự động của Claude Code được thử nghiệm trong bài chỉ hoạt động trong từng kho mã.
Theo The New Stack, xAI công bố tính năng bộ nhớ cho Grok Build vào ngày 16 tháng 9. Công cụ lưu quy ước, quyết định và dữ kiện dự án trong các tệp Markdown. Bộ nhớ có một phạm vi riêng cho từng không gian làm việc và một phạm vi toàn cục dùng ở mọi nơi. Người dùng có thể duyệt các ghi chú bằng lệnh /memory.
Claude Code đã có cơ chế tương tự trong nhiều tháng dưới tên bộ nhớ tự động. Theo tài liệu của Anthropic được The New Stack dẫn lại, công cụ duy trì một tệp chỉ mục MEMORY.md cùng các tệp ghi chú riêng trong từng kho mã và bật tính năng này theo mặc định.
Anthropic cũng công bố bản thử nghiệm Projects có bộ nhớ dùng chung vào ngày 17 tháng 9. Tuy nhiên, The New Stack cho biết tính năng này chỉ dành cho một số người dùng gói Pro và Max chưa có dự án hiện hữu. Vì vậy, bài thử tập trung vào công cụ dòng lệnh mà người dùng phổ thông có thể sử dụng.
Cách tiến hành ba bài thử
The New Stack kiểm tra khả năng nhớ lại bằng ba nhiệm vụ trên bốn kho mã Node nhỏ. Mỗi nhiệm vụ có hai phiên tách biệt: phiên đầu cung cấp dữ kiện, còn phiên sau yêu cầu công cụ áp dụng dữ kiện đó mà không được nhắc lại. Cách làm này kiểm tra cả việc lưu và sử dụng bộ nhớ.
The New Stack chạy cả hai công cụ trên máy Mac, mỗi công cụ sử dụng bản sao riêng của bốn kho mã được tạo cho thử nghiệm. Grok Build 1.0.40 chạy Grok 4.6 ở mức nỗ lực cao qua khóa giao diện lập trình của xAI. Claude Code 2.1.226 chạy Opus 5 bằng gói thuê bao của tác giả.
Sau phiên đầu, từng công cụ được đóng hoàn toàn trước khi phiên thứ hai bắt đầu. Chế độ chạy không giao diện của mỗi công cụ tự báo lượng token và chi phí.
Cách kiểm tra này tập trung vào hành vi thực tế thay vì chỉ nhìn vào tệp cấu hình. Đây cũng là điểm quan trọng khi đánh giá cách tác tử AI viết mã hoạt động: việc tạo ghi chú chưa đủ, công cụ còn phải đọc lại và làm đúng theo ghi chú trong phiên sau.
Bài thử lệnh kiểm thử
Cả Grok Build và Claude Code đều nhớ rằng kho mã phải chạy make test thay cho npm test. Claude hoàn thành nhanh hơn 7 giây, nhưng dùng 186.000 token và tốn 0,32 USD, so với 102.000 token và 0,11 USD của Grok theo số liệu The New Stack ghi nhận.
Trong kho mã đầu tiên, lệnh npm test không thành công còn make test chạy được. Phiên đầu nói rõ điều này. Trước phiên thứ hai, dòng hướng dẫn trỏ đến tệp Makefile trong README bị xóa. Sau đó, mỗi công cụ được yêu cầu thêm một điểm cuối mới và bảo đảm các bài kiểm thử đều đạt.
Theo The New Stack, cả hai công cụ đều lưu quy tắc ngay khi nhận được. Grok tạo tệp topics/testing.md cùng hai quan sát thô. Claude Code tạo tệp orbit-api-run-tests-with-make.md, trong đó giải thích lý do và cách áp dụng.
Ở phiên tiếp theo, Grok bắt đầu bằng việc đọc các tệp bộ nhớ, chạy make test và không dùng npm test. Claude Code đọc Makefile cùng package.json, sau đó cũng chỉ chạy make test.
Grok mất 29 giây, dùng 102.000 token và tốn 0,11 USD. Claude Code mất 22 giây, dùng 186.000 token và tốn 0,32 USD. Claude dùng nhiều hơn khoảng 80.000 token và có chi phí gần gấp ba lần trong bài thử này.
Bài thử quyết định dự án có cài bẫy
Cả hai công cụ đều nhớ hai quyết định dự án dù kho mã chứa những thành phần có thể dẫn chúng đi sai hướng. Grok và Claude đều dùng số nguyên cent cho chức năng hoàn tiền và xuất đơn hàng dưới dạng JSON thay vì khôi phục trình xuất CSV đang làm dở.
Phiên đầu đặt ra hai quyết định: tính năng xuất CSV đã bị loại bỏ, còn tiền phải được lưu dưới dạng số nguyên theo cent, không dùng số thực. Kho mã vẫn chứa một hàm hỗ trợ số thực và một trình xuất CSV đang làm dở để kiểm tra liệu tác tử có bị mã hiện hữu dẫn sai hướng hay không.
Kết quả về nội dung hoàn tiền và xuất dữ liệu
Trong phiên thứ hai, công cụ được yêu cầu tạo một điểm cuối hoàn tiền nhận một khoản tiền và cung cấp cách để nhân viên hỗ trợ tải toàn bộ đơn hàng. Theo The New Stack, cả Grok Build lẫn Claude Code đều ghi lại hai quyết định. Claude Code còn chuyển cụm “quý trước” thành “quý 2 năm 2026” trong ghi chú.
Cả hai xây dựng chức năng hoàn tiền bằng số nguyên cent, đặt tên trường là amountCents và không đụng đến hàm số thực. Với yêu cầu tải đơn hàng, hai công cụ đều xuất dữ liệu JSON. Grok nhận ra giao diện lập trình chỉ dùng JSON nên không nối lại phần CSV. Claude Code thêm tiêu đề content-disposition để trình duyệt tải JSON dưới dạng tệp.
The New Stack đo được Grok hoàn thành trong 103 giây, dùng 156.000 token và tốn 0,18 USD. Claude Code hoàn thành trong 32 giây, dùng 269.000 token và tốn 0,49 USD. Hai công cụ đều làm đúng cả hai quyết định, nhưng Claude Code có chi phí cao hơn gấp đôi.
Bài thử quy tắc xuyên dự án
Bài thử xuyên dự án tạo ra khác biệt quyết định. Grok Build lưu quy tắc vào bộ nhớ toàn cục và áp dụng chúng trong kho mã mới. Claude Code lưu cùng quy tắc trong thư mục của kho mã đầu tiên, nên không tuân thủ quy ước về thông điệp cam kết khi chuyển sang kho mã thứ hai.
Trong kho mã A, phiên đầu đặt hai quy tắc áp dụng cho mọi dự án: thông điệp cam kết phải theo quy ước và không viết chú thích cho đoạn mã đã quá rõ ràng. Phiên thứ hai chuyển sang một kho mã B không liên quan, yêu cầu thêm một tính năng nhỏ rồi tạo cam kết.
Theo The New Stack, Grok lưu hai quy tắc vào phạm vi toàn cục trong tệp git-and-code-style.md. Tại kho mã thứ hai, công cụ tạo cam kết feat: add --help, bổ sung hướng dẫn sử dụng cùng các thành phố được hỗ trợ và không thêm chú thích. Grok hoàn thành sau 33 giây, dùng 132.000 token và tốn 0,12 USD.
Khác biệt khi chuyển sang kho mã mới
Claude Code cũng lưu cả hai quy tắc nhưng chỉ trong thư mục bộ nhớ của kho mã đầu tiên. Công cụ còn cảnh báo rằng nơi lưu bộ nhớ chỉ giới hạn trong thư mục dự án. Khi chạy ở kho mã thứ hai, Claude không tìm thấy ghi chú và tạo cam kết Add --help flag. Công cụ không thêm chú thích, nhưng tác giả lưu ý đây vốn là hành vi mặc định của Claude.
The New Stack chấm Claude đạt quy tắc không thêm chú thích nhưng không đạt quy tắc về thông điệp cam kết xuyên dự án. Công cụ hoàn thành sau 12 giây, dùng 122.000 token và tốn 0,24 USD.
Ranh giới giữa các kho mã có ý nghĩa lớn với nhóm dùng tác tử trên nhiều sản phẩm. Những vấn đề tương tự cũng xuất hiện khi xác minh 2.000 yêu cầu hợp nhất mỗi tháng, bởi một quy tắc chỉ có giá trị khi hệ thống áp dụng đúng tại nơi cần đến nó.
Kết quả tổng hợp
Grok Build thắng về số bài thử đạt, lượng token và chi phí, còn Claude Code thắng về tốc độ. Theo tổng hợp của The New Stack, Grok đạt 3 trên 3 bài với chi phí 0,41 USD. Claude đạt 2 trên 3 bài, hoàn thành nhanh hơn 99 giây nhưng tốn 1,05 USD.
| Chỉ số | Grok Build dùng Grok 4.6 | Claude Code dùng Opus 5 |
|---|---|---|
| Số bài thử đạt | 3 trên 3 | 2 trên 3 |
| Tổng thời gian | 165 giây | 66 giây |
| Tổng token | 390.848 | 576.863 |
| Tổng chi phí | 0,41 USD | 1,05 USD |
Nguồn số liệu trong bảng: thử nghiệm của The New Stack với Grok Build 1.0.40 dùng Grok 4.6 và Claude Code 2.1.226 dùng Opus 5.
Đánh đổi giữa tốc độ và phạm vi ghi nhớ
Trong hai tình huống chỉ liên quan đến một dự án, kết quả của chúng không khác nhau: cả hai đều ghi dữ kiện thành tệp Markdown, đọc lại ở phiên sau và làm theo.
Claude Code nhanh hơn trong mọi phiên nhớ lại. Claude mất tổng cộng 66 giây so với 165 giây của Grok. Đổi lại, Claude dùng 576.863 token và tốn 1,05 USD, còn Grok dùng 390.848 token với chi phí 0,41 USD. Tác giả The New Stack cho rằng chênh lệch giá chủ yếu phản ánh sự khác nhau giữa Opus 5 và Grok 4.6, không chỉ riêng hệ thống bộ nhớ.
Kết quả này cần được đọc cùng giới hạn của phép thử. Đây là ba tình huống trên bốn kho mã Node nhỏ, không phải đánh giá mọi loại dự án. Phép thử vẫn cho thấy một khác biệt có thể kiểm tra được: bộ nhớ toàn cục của Grok mang quy tắc sang kho mã thứ hai, còn bộ nhớ dòng lệnh theo từng kho của Claude Code không làm được điều đó.
Nên chọn Grok Build hay Claude Code?
Grok Build phù hợp hơn nếu nhóm cần duy trì quy tắc giữa nhiều kho mã hoặc ưu tiên chi phí trong cấu hình được thử nghiệm. Claude Code phù hợp hơn nếu tốc độ là tiêu chí chính và các quy tắc chỉ cần dùng trong một kho mã, hoặc nhóm sẵn sàng quản lý quy tắc toàn cục theo cách thủ công.
Dựa trên thử nghiệm của The New Stack, Grok Build đạt 3 trên 3 bài, trong khi tổng chi phí 0,41 USD thấp hơn một nửa mức 1,05 USD của Claude Code.
Claude Code có lợi thế rõ ràng về tốc độ. Tổng thời gian 66 giây của Claude thấp hơn đáng kể so với 165 giây của Grok. Tác giả cũng đánh giá ghi chú bộ nhớ của Claude được viết tốt hơn. Tuy nhiên, với công cụ dòng lệnh được thử nghiệm, quy tắc cần dùng ở mọi dự án vẫn phải được thêm thủ công vào ~/.claude/CLAUDE.md.
Với nhóm đang theo dõi tác động của AI lên chất lượng phần mềm, kết quả này bổ sung một góc nhìn thực tế cho câu chuyện AI viết mã tăng đầu ra nhưng cũng làm tăng mã lặp: tốc độ chỉ là một phần, còn khả năng duy trì quyết định qua nhiều phiên và nhiều kho mã mới quyết định tác tử có làm đúng ý định ban đầu hay không.
Nếu đang chọn tác tử viết mã cho nhiều kho mã, hãy thử chính các quy tắc xuyên dự án của nhóm trước khi đưa công cụ vào quy trình hằng ngày.


