
Amazon Web Services, gọi tắt là AWS, đang mở mã nguồn Strands Harness, một tác tử AI đa dụng có thể chạy trên máy cá nhân hoặc được triển khai lên đám mây. Theo The New Stack, AWS đo được chi phí thấp hơn Claude Code và Codex 45% trong thử nghiệm nội bộ, trong khi độ chính xác nhìn chung tương đương. Kết quả này chưa được đánh giá độc lập và không đồng nghĩa mọi khối lượng công việc đều tiết kiệm 45%.
Strands Harness được xây dựng trên Strands Agents, bộ công cụ Python mã nguồn mở được AWS giới thiệu vào tháng 5 năm 2025. Nhà phát triển cung cấp mô hình, công cụ và chỉ dẫn. Mô hình quyết định cách xử lý nhiệm vụ và thời điểm gọi từng công cụ. AWS sau đó đưa Strands sang TypeScript và thành lập Strands Labs vào tháng 2 để phát triển các dự án thử nghiệm.
Marc Brooker, phó chủ tịch kiêm kỹ sư cao cấp tại AWS, mô tả Strands Harness là một lớp nằm phía trên bộ công cụ Strands hiện có. Thay vì tự ghép từng thành phần, nhà phát triển nhận được một tác tử đã cấu hình để xử lý các nhiệm vụ kéo dài.
Nội dung của Strands Harness có những gì?
Strands Harness đóng gói các công cụ làm việc với tệp, trình lệnh và trang web cùng những thành phần cần cho nhiệm vụ dài hạn. Hệ thống quản lý ngữ cảnh, bộ nhớ, phiên làm việc, bộ nhớ đệm câu lệnh và việc chuyển nhiệm vụ cho tác tử khác, nhưng vẫn cho phép nhà phát triển thay đổi từng phần.
Nhà phát triển có thể điều chỉnh tác tử cho từng công việc cụ thể bằng cách thay đổi chỉ dẫn, chọn mô hình, giới hạn công cụ và năng lực được phép sử dụng, hoặc quyết định tác tử có thể giao việc cho tác tử khác hay không. Đây là khác biệt giữa một tác tử được cấu hình sẵn và việc dùng bộ công cụ để tự xây toàn bộ hệ thống.
Theo Brooker, bộ công cụ chỉ cung cấp các khối xây dựng. Người triển khai vẫn phải quyết định cách quản lý ngữ cảnh, lưu cuộc hội thoại, tích hợp công cụ và định hướng hành vi của tác tử. Strands Harness đóng gói sẵn các lựa chọn đó mà không ngăn nhà phát triển sửa đổi chúng.
Phần lớn Strands Harness không phụ thuộc vào hạ tầng AWS. Vòng lặp tác tử, công cụ, quản lý ngữ cảnh, phiên làm việc và cơ chế chuyển giao nhiệm vụ đều nằm trong bản mã nguồn mở. AWS cho biết các quá trình này mặc định chạy ngay trên thiết bị đang vận hành tác tử.
Amazon Bedrock là mặc định, không phải yêu cầu
Strands Harness mặc định gọi mô hình qua Amazon Bedrock, nhưng AWS không bắt buộc nhà phát triển sử dụng dịch vụ này. Brooker cho biết nhà cung cấp mô hình có thể được thay bằng một dòng cấu hình. Quản lý ngữ cảnh, công cụ, phiên làm việc và cơ chế chuyển giao nhiệm vụ vẫn hoạt động theo cùng một cách sau khi thay đổi.
Hệ thống hỗ trợ Anthropic, OpenAI và Google, đồng thời có thể kết nối với mô hình chạy cục bộ qua Ollama. Thay nhà cung cấp không nhất thiết đồng nghĩa với thay mô hình. Tuy nhiên, việc chọn mô hình khác có thể ảnh hưởng đến khả năng suy luận, cách dùng công cụ và chi phí.
AWS khẳng định không có tính năng nào của Strands Harness bắt buộc phải dùng Bedrock. Nhà phát triển cũng có thể bổ sung công cụ và kỹ năng riêng, kết nối máy chủ theo giao thức ngữ cảnh mô hình, thay đổi cách xử lý ngữ cảnh hoặc chọn nơi lưu trạng thái phiên.
Với các nhóm đang tìm hiểu cách tác tử AI viết mã hoạt động, điểm đáng chú ý là Strands Harness tách phần điều phối khỏi mô hình nền và nhà cung cấp hạ tầng. Cấu trúc này cho phép nhóm phát triển đổi nhà cung cấp mà không phải thay toàn bộ cơ chế vận hành tác tử.
Một tác tử đa dụng thay vì trợ lý viết mã
AWS định vị Strands Harness là tác tử đa dụng, không phải trợ lý viết mã chuyên biệt. Sản phẩm học hỏi từ Claude Code và Codex nhưng được thiết kế cho nhiều loại nhiệm vụ hơn. AWS cũng cho phép triển khai Strands Harness trên các nền tảng đám mây khác thay vì giới hạn tác tử trong hệ sinh thái của hãng.
Strands Harness có giao diện dòng lệnh để tạo mẫu và cấu hình tác tử theo cách tương tác. Nhà phát triển có thể chọn mô hình, thêm câu lệnh, công cụ và năng lực, sau đó dùng lệnh /export để xuất cấu hình thành mã Python hoặc TypeScript.
AWS còn cung cấp một kỹ năng dành cho tác tử viết mã. Kỹ năng này giúp tác tử hiểu Strands Harness, kết nối máy chủ theo giao thức ngữ cảnh mô hình và tạo cấu hình triển khai cho AWS, GCP, Azure, Cloudflare hoặc Modal.
Cách tiếp cận này liên quan trực tiếp đến việc vận hành hạ tầng AI. Mô hình chỉ là một phần của hệ thống. Chi phí thực tế còn phụ thuộc vào cách tác tử giữ ngữ cảnh, gọi công cụ và phục hồi sau lỗi.
AWS đo mức tiết kiệm 45% như thế nào?
AWS chạy Strands Harness và các hệ thống được so sánh trên sáu bộ đánh giá: ALFWorld, ContextBench, GAIA, WebShop, τ³-bench và Terminal-Bench 2.1. Công ty lấy điểm trung bình trên sáu bộ đánh giá rồi đối chiếu với chi phí trung bình cho mỗi nhiệm vụ. Vì AWS tự thực hiện phép đo, kết quả cần được xem là thử nghiệm của nhà cung cấp.
Theo số liệu AWS cung cấp cho The New Stack, Strands Harness rẻ hơn Claude Code và Codex 45%, với độ chính xác nhìn chung tương đương. Khi DeepSeek Harness được đưa vào phạm vi so sánh, mức chênh lệch giảm còn 28%. Trong các lượt chạy tương ứng, AWS cho biết DeepSeek Harness rẻ hơn Strands Harness khoảng 14%.
AWS cho rằng kết quả chủ yếu đến từ cách Strands Harness quản lý ngữ cảnh. Hệ thống cắt bớt đầu ra công cụ quá lớn, nén ngữ cảnh khi cửa sổ khả dụng vượt ngưỡng đã đặt và cố gắng tự phục hồi trong vòng lặp tác tử nếu ngữ cảnh bị tràn.
Kết quả riêng trên Terminal-Bench 2.1

Theo số liệu AWS cung cấp cho The New Stack, trên Terminal-Bench 2.1, Strands Harness chạy Fable 5 tốn ít hơn Claude Code 77%. Tổng chi phí qua 89 lượt thử là 56,29 USD, so với 248,05 USD của Claude Code. Điểm số tương ứng là 69,7 và 61,8.
DeepSeek Harness có chi phí thấp hơn, ở mức 40,30 USD, nhưng đạt 59,5 điểm. Các số liệu này đều đến từ thử nghiệm của AWS và chưa phải kết quả đánh giá độc lập. Phép so sánh cũng cho thấy lựa chọn có chi phí thấp nhất không nhất thiết đạt điểm số cao nhất.
Brooker nhận định việc tạo nguyên mẫu chỉ là bước đầu. Nhóm phát triển còn phải đánh giá cách lựa chọn về ngữ cảnh, công cụ và phiên làm việc tác động đến hiệu năng và chi phí. AWS xem Strands Harness là cách đóng gói phần kỹ thuật đó thành một tác tử đa dụng hoàn chỉnh.
AWS được gì từ dự án mã nguồn mở?
Strands Harness có thể được dùng miễn phí và triển khai ngoài AWS, nhưng dự án cũng tạo đường dẫn đến dịch vụ thương mại của hãng. Amazon Bedrock AgentCore cung cấp hạ tầng lưu trữ, kiểm soát danh tính, quản lý quyền truy cập và khả năng quan sát cho các tác tử được tạo bằng Strands Harness.
AgentCore Harness và Strands Harness do cùng một nhóm phát triển nhưng nằm trong hai kho mã riêng. Theo Brooker, cải tiến từ dự án mã nguồn mở có thể được đưa vào dịch vụ được quản lý. Những cải tiến từ dịch vụ cũng có thể quay lại dự án mã nguồn mở.
Mô hình này tạo cho AWS một lộ trình thương mại rõ ràng. Nhà phát triển có thể bắt đầu với Strands Harness và triển khai trên hạ tầng tự chọn. Khi một nhóm muốn giao việc vận hành hạ tầng cho nhà cung cấp, AgentCore là lựa chọn do AWS cung cấp.
Brooker khẳng định AgentCore chỉ là lớp lưu trữ tùy chọn cho những nhóm muốn AWS phụ trách hạ tầng. Strands Harness vẫn có thể hoạt động độc lập, còn phương án triển khai do nhà phát triển quyết định.
Ý nghĩa đối với doanh nghiệp trong nước
Đối với doanh nghiệp trong nước, mức tiết kiệm 45% theo số liệu AWS cung cấp cho The New Stack đáng theo dõi nhưng cần được hiểu đúng phạm vi. Đây là kết quả thử nghiệm do AWS thực hiện trên sáu bộ đánh giá, không phải cam kết rằng mọi khối lượng công việc đều giảm chi phí ở cùng mức. Hiệu quả thực tế phụ thuộc vào mô hình, công cụ, nhiệm vụ và cách nhóm phát triển cấu hình tác tử.
Nếu đang cân nhắc triển khai tác tử AI, bạn có thể theo dõi thêm các phân tích kỹ thuật của Sine để đối chiếu chi phí, hiệu năng và mức độ phụ thuộc vào từng nền tảng.


