
Anthropic thiết kế Claude Opus 5.5 để xử lý tác vụ trong suốt vòng đời phát triển phần mềm. Phạm vi đó kéo dài từ lập đặc tả đến tạo mã. Mô hình còn có thể gỡ lỗi và kiểm thử kết quả. Theo The New Stack, đây là mẫu đầu tiên trong dòng Claude 5.5. Nó đánh dấu bước chuyển từ công cụ gợi ý mã sang tác tử có khả năng hoàn tất công việc.
Theo Anthropic, Opus 5.5 đạt hiệu năng ngang Claude Fable 5.1 trong phần lớn tác vụ công việc. Chi phí vận hành của mẫu này thấp hơn Opus 5 khoảng 40%. Mục tiêu đó phản ánh kỳ vọng mới đối với tác tử trí tuệ nhân tạo viết mã. Tác tử có thể nhận một đầu việc rõ ràng, thực hiện các bước và kiểm tra kết quả trong cùng vòng làm việc. Tuy nhiên, kỹ sư vẫn phải xác minh kết quả có chính xác và đáp ứng tiêu chí nghiệm thu hay không.
Từ viết mã sang hoàn tất cả đầu việc
Claude Opus 5.5 hướng tới việc hoàn thành một đầu việc có thể kiểm chứng thay vì chỉ tạo ra mã nguồn. Tác tử có thể chạy lệnh, đọc lỗi và sửa tệp trong cùng một vòng làm việc. Nó cũng kiểm tra lại kết quả, nhờ đó giảm số bước thủ công của lập trình viên.
Mario Rodriguez, giám đốc sản phẩm của GitHub, mô tả các thử nghiệm với GitHub Copilot CLI và VS Code. Trong các thử nghiệm đó, Claude Opus 5.5 thuộc nhóm sử dụng ít token (đơn vị văn bản mô hình xử lý) và ít bước nhất. Riêng trong VS Code, mẫu này giải quyết nhiều tác vụ ở cửa sổ lệnh hơn Opus 5. Số bước cần dùng chưa đến một nửa. Rodriguez cho rằng hiệu quả này có thể giúp lập trình viên xử lý những dự án lớn hơn.
Sergey Ermakovich, đồng sáng lập HasData, nhận xét rằng cửa sổ lệnh đã trở thành một phần trong không gian làm việc của mô hình. Đây không còn chỉ là nơi lập trình viên dán mã do trí tuệ nhân tạo tạo ra. Quyền truy cập vào môi trường thực thi cho phép tác tử tiếp tục làm việc sau khi tạo mã. Tác tử cũng có thể xác minh kết quả trước khi dừng.
Cách làm này phù hợp với các phần việc nhỏ nhưng hoàn chỉnh. Ví dụ gồm sửa một bài kiểm thử đang lỗi hoặc cập nhật thư viện phụ thuộc. Tác tử cũng có thể chuyển đổi một điểm cuối rồi xác minh kết quả trước khi làm việc tiếp theo. Vì vậy, các nhóm phát triển phải chú ý hơn đến vai trò của khâu xác minh trong quy trình rà soát mã.
Hoàn thành chưa đồng nghĩa với chính xác
Một tác tử có thể báo đã hoàn thành dù kết quả vẫn chứa lỗi hoặc tạo ra chi phí kỹ thuật về sau. Claude Opus 5.5 vì thế không loại bỏ vai trò của kỹ sư. Con người vẫn phải kiểm tra giả định, xem lại thay đổi và đối chiếu kết quả với tiêu chí nghiệm thu.
Akash Thakur, kiến trúc sư độc lập về độ tin cậy của hệ thống và trí tuệ nhân tạo, đánh giá cao khả năng chia dự án thành những phần nhỏ có thể hoàn tất của Opus 5.5. Tuy nhiên, ông cho rằng vấn đề khó hơn là giúp mô hình nhận ra khi nào nó chưa thật sự hoàn thành công việc.
“Hoàn thành” và “chính xác” không phải là một. Một tác vụ trông có vẻ đã xong vẫn có thể khiến nhóm phát triển phải trả giá về sau.
Vai trò của kỹ sư chuyển từ trực tiếp viết mọi dòng mã sang kiểm tra giả định và xem lại thay đổi. Kỹ sư cũng phải xác minh kết quả. Nhận định của Thakur cho thấy vai trò của kỹ sư trong thời đại trí tuệ nhân tạo vẫn cần năng lực phán đoán và giám sát, thay vì chỉ vận hành công cụ.
Xử lý kho mã lớn trong vài giờ
Anthropic định vị Opus 5.5 cho các công việc dài trên toàn bộ kho mã. Ví dụ gồm chuyển đổi hệ thống hoặc kiểm toán mã. Các thử nghiệm do công ty công bố cho thấy mẫu này có thể giảm thời gian xử lý. Mẫu này cũng dùng ít token hơn Opus 5 trong những tác vụ có phạm vi lớn.
Số liệu về nội dung kho mã lớn
Theo số liệu Anthropic công bố và The New Stack dẫn lại, một người thử nghiệm sớm đã dùng Opus 5.5 để kiểm toán và sửa kho mã. Kho mã này gồm 200.000 dòng, còn thời gian xử lý chưa đầy ba giờ. Theo cùng số liệu, Opus 5 mất hơn 20 giờ cho công việc đó. Mẫu này cũng sử dụng lượng token gấp 2,5 lần.
Trong một thử nghiệm nội bộ khác, Anthropic giao cho hai mô hình nhiệm vụ chuyển HAProxy từ C sang Rust. Opus 5.5 và Fable 5.1 đều vượt qua gần như toàn bộ bộ kiểm thử hồi quy của HAProxy. Theo Anthropic, Opus 5.5 hoàn thành trong 9,5 giờ, còn Fable 5.1 cần 12 giờ. Chi phí của Opus 5.5 thấp hơn 51%.

Eric Paulsen là giám đốc công nghệ phụ trách châu Âu, Trung Đông và châu Phi tại Coder. Theo ông, khi tác tử có thể hoàn thành công việc thực tế, vấn đề cần xem xét là môi trường hoạt động. Trọng tâm không còn chỉ nằm ở năng lực của mô hình.
Theo Paulsen, một phiên Claude Code không nên chạy trên máy tính xách tay có thể bị xâm nhập, thất lạc hoặc thiếu tài nguyên. Tác tử cần hạ tầng chuyên dụng với cơ chế quản trị và quản lý thông tin bí mật. Hạ tầng đó cũng cần giám sát hoạt động cùng các rào chắn dành cho khối lượng công việc sản xuất. Đây là một phần của hạ tầng trí tuệ nhân tạo và cách vận hành.
Các rào chắn có thể chuyển yêu cầu sang mẫu khác
Opus 5.5 có thể chuyển một số yêu cầu sang mẫu Claude khác khi cơ chế bảo vệ được kích hoạt. Anthropic cho biết việc chuyển mẫu diễn ra ở phía hệ thống. Người dùng có thể không nhìn thấy bước này, nhất là với yêu cầu về an ninh mạng hoặc sinh học. Điều tương tự áp dụng cho yêu cầu phát triển mô hình tiên tiến.
Anthropic cho biết Frontier Design và METR đã kiểm tra Opus 5.5 trước khi phát hành. Công ty cũng áp dụng kiểm thử căn chỉnh, đánh giá trước phát hành và các biện pháp bảo vệ cho những lĩnh vực có rủi ro cao như an ninh mạng và sinh học.
Theo Anthropic, Opus 5.5 đạt kết quả tốt nhất trong số các mẫu mà công ty từng đưa vào bài kiểm tra căn chỉnh toàn diện nhất. Mẫu này cải thiện một số hành vi từng góp phần vào các sự cố an ninh mạng gần đây, trong đó có suy luận thiên lệch và hành vi tìm cách thoát khỏi môi trường cô lập.
Khi biện pháp bảo vệ của Opus 5.5 được kích hoạt, phần lớn tác vụ an ninh mạng sẽ được chuyển sang Opus 4.8. Các yêu cầu bị bộ phân loại về sinh học hoặc phát triển mô hình ngôn ngữ tiên tiến đánh dấu sẽ được chuyển sang Opus 5.
Các tổ chức đã qua thẩm định có thể đăng ký Chương trình Xác minh Khoa học Sự sống của Anthropic để sử dụng Opus 5.5 cho nghiên cứu sinh học. Công ty cũng cho biết sẽ mở rộng Chương trình Xác minh An ninh mạng trong những tuần tiếp theo.
Cửa sổ lệnh trở thành nơi tác tử làm việc
Quyền làm việc trong cửa sổ lệnh giúp Claude Opus 5.5 quan sát trạng thái dự án và thử thay đổi. Mô hình có thể nhận lỗi rồi sửa tiếp. Vòng phản hồi này kết nối việc tạo mã với thực thi và kiểm thử. Lập trình viên không phải tự hoàn thành mọi bước sau khi mô hình trả về mã nguồn.
John Ruelas là staff software engineer tại Ramp. Ông cho biết đầu ra dài dòng, khó theo dõi từng là nhược điểm gây khó chịu nhất ở các mẫu tiên tiến. Với Opus 5.5, ông nhận thấy cách viết rõ ràng hơn. Mô hình cũng tuân thủ quy tắc viết của công ty. Một bản đặc tả thiết kế chỉ cần chỉnh sửa rất ít trước khi sử dụng.
Khi Opus 5.5 tối ưu hóa bộ kiểm thử của nhóm, Ruelas cho biết ông có thể theo dõi quá trình suy luận và triển khai thay đổi với sự tự tin. Khả năng quan sát quá trình làm việc giúp kỹ sư đánh giá kết quả thay vì chỉ nhận một đoạn mã cuối cùng.

Kỷ nguyên tự động hoàn thành mã đang khép lại
Claude Opus 5.5 phản ánh sự chuyển dịch từ tự động hoàn thành dòng mã sang xử lý cả đầu việc. Mỗi đầu việc cần có tiêu chí nghiệm thu. Khả năng chủ động cao hơn phải đi cùng quyền truy cập được kiểm soát và môi trường chạy phù hợp. Kỹ sư vẫn phải xác minh thay đổi trước khi đưa chúng vào hệ thống thật.
Maxime Vermeir, phó chủ tịch chiến lược trí tuệ nhân tạo tại Abbyy, nhận xét về khả năng xử lý toàn bộ vòng đời phát triển phần mềm. Theo ông, những khả năng đó cho thấy thời kỳ tự động hoàn thành mã đơn giản đang kết thúc. Trước đây, việc trí tuệ nhân tạo viết tiếp dòng mã kế tiếp đã được xem là đáng chú ý. Kỳ vọng hiện nay là giao cả một phiếu công việc trên Jira và nhận lại kết quả hoàn chỉnh.
Vermeir vẫn đặt câu hỏi về mức độ các mẫu mới hiểu đúng khái niệm “xong việc”. Một tác tử có thể tiếp tục tiêu thụ token để đề xuất thêm việc. Trong khi đó, phần trước có thể vẫn chưa được thực hiện đúng. Vì vậy, tiêu chí nghiệm thu phải được xác định rõ trước khi tác tử bắt đầu làm việc.
Chi phí và tốc độ xử lý
Anthropic công bố giá Opus 5.5 là 4 USD cho mỗi một triệu token đầu vào. The New Stack dẫn lại con số này. Giá cho mỗi một triệu token đầu ra là 20 USD. Mức giá đó thấp hơn Opus 5 khoảng 20%. Cũng theo Anthropic, giá đọc bộ nhớ đệm giảm 60% với hình thức tính phí theo token.
Theo Anthropic, Opus 5.5 cần ít token hơn để tạo kết quả chất lượng cao. Công ty cũng cho biết mẫu này tạo đầu ra nhanh hơn Opus 5 trên 30%. Các số liệu đó cho thấy Anthropic đang cạnh tranh bằng khả năng hoàn thành trọn vẹn công việc. Trọng tâm không còn chỉ là cải thiện chất lượng của từng đoạn mã.
Với các nhóm phát triển trong nước, những yếu tố cần đánh giá gồm phạm vi công việc tác tử được giao, môi trường chạy, quyền truy cập và quy trình xác minh trước khi đưa thay đổi vào hệ thống thật.
Hãy theo dõi Sine để cập nhật cách các tác tử lập trình đang thay đổi quy trình phát triển phần mềm.


