Claude Sonnet 5.5 có thể chuyển sang Sonnet 5

Claude Sonnet 5.5 có thể chuyển một số yêu cầu sang Sonnet 5 khi bộ lọc an toàn kích hoạt. Cách chuyển phụ thuộc vào ứng dụng, giao diện lập trình và cấu hình dự phòng.

Lập trình viên làm việc trước màn hình trong môi trường thiếu sáng
Định tuyến mô hình có thể thay đổi cách yêu cầu được xử lý.

Claude Sonnet 5.5 có thể chuyển một số yêu cầu sang Sonnet 5 khi hệ thống an toàn mạng chặn nội dung. Trên ứng dụng của Anthropic, quá trình dự phòng có thể diễn ra tự động. Nhà phát triển dùng giao diện lập trình phải chủ động bật chức năng này. Vì vậy, mô hình được chọn ban đầu chưa chắc là mô hình thực sự tạo câu trả lời.

Theo bài phân tích gốc của The New Stack, Sonnet 5.5 là mẫu Sonnet đầu tiên ra mắt với biện pháp bảo vệ an toàn mạng. Mô hình cũng có cơ chế dự phòng tương tự nhóm mô hình mạnh nhất của Anthropic. Cơ chế định tuyến này ảnh hưởng trực tiếp đến các đội dùng Claude để lập trình, kiểm tra mã hoặc vận hành tác tử.

Anthropic không xem Sonnet 5.5 là bước tiến mới về năng lực tổng thể. Tuy vậy, hãng đánh giá kỹ năng an toàn mạng của mô hình tương đương Opus 5. Trên Terminal-Bench 4.0 dành cho tác tử lập trình, Sonnet 5.5 đạt 70,6%. Opus 5.5 đạt 66,4% ở mức nỗ lực cao nhất. The New Stack dẫn các số liệu này từ thông tin của Anthropic.

Năng lực khai thác tăng kéo theo lớp bảo vệ mới

Anthropic bổ sung lớp bảo vệ vì Sonnet 5.5 cải thiện rõ rệt ở một số tác vụ tấn công an toàn mạng. Mô hình vẫn đứng dưới các hệ thống mạnh nhất của hãng trong lĩnh vực này, nhưng khoảng cách lớn so với Sonnet 5 đã đủ để Anthropic áp dụng cơ chế kiểm soát từng dành cho dòng Opus.

Tài liệu hệ thống Claude Sonnet 5.5 của Anthropic mô tả kết quả khi tắt biện pháp bảo vệ. Mô hình thực thi mã tùy ý hoàn chỉnh trong 178 trên 410 lượt chạy ExploitBench.

Lập trình viên theo dõi kết quả kiểm thử mô hình trên màn hình
Kết quả kiểm thử dẫn đến lớp bảo vệ mới.

Cũng theo tài liệu này, Sonnet 5.5 hoàn thành 46,1% thử thách trong CyScenarioBench của Irregular, tăng từ 0,7% ở Sonnet 5. Trong một bài đánh giá khai thác tệp nhị phân dựa trên kho OSS-Fuzz của Google, Sonnet 5.5 thực hiện được 50 vụ chiếm quyền điều khiển luồng, trong khi Sonnet 5 chỉ đạt ba vụ.

Anthropic vẫn xếp Sonnet 5.5 dưới Opus 5.5 và Mythos 5.1 về năng lực an toàn mạng. Tuy nhiên, mô hình đã đủ mạnh trong một lĩnh vực cụ thể để cần lớp kiểm soát nghiêm ngặt hơn, dù chưa đứng đầu về năng lực chung.

Ba tầng kiểm soát quyết định yêu cầu có bị chặn hay không

Hệ thống của Anthropic dùng ba tầng kiểm soát để đánh giá yêu cầu. Tầng đầu là một đầu dò đọc trạng thái kích hoạt bên trong mô hình. Tiếp theo là bộ phân loại nhẹ chạy trên Sonnet 5.5 và một mô hình ngôn ngữ được huấn luyện riêng. Tầng cuối cân nhắc kết quả từ đầu dò trước khi quyết định có chặn cuộc hội thoại hay không.

Anthropic cho biết các bộ phân loại phát hiện yêu cầu gây hại liên quan đến an toàn mạng với tỷ lệ tương đương hệ thống trên Opus 5. Công ty áp dụng biện pháp chống vượt rào ít quyết liệt hơn vì Sonnet 5.5 chưa mạnh bằng các mô hình hàng đầu của hãng trong lĩnh vực này.

Người dùng vẫn có thể gặp nhiều lần từ chối hơn so với Sonnet 5, kể cả khi làm công việc an toàn mạng hợp pháp. Với các nhóm đang triển khai tác tử lập trình bằng AI, khác biệt này cần được đưa vào quy trình kiểm thử thay vì xem Sonnet 5.5 là bản thay thế trực tiếp.

Khi nào Sonnet 5.5 chuyển yêu cầu sang Sonnet 5?

Sonnet 5.5 có thể chuyển sang Sonnet 5 khi một yêu cầu an toàn mạng bị chặn hoặc khi yêu cầu thuộc nhóm hẹp các tác vụ phát triển mô hình ngôn ngữ tuyến đầu. Một số loại nội dung khác sẽ bị chặn hoàn toàn và không được gửi tới mô hình dự phòng.

The New Stack cho biết phần lớn tác vụ an toàn mạng gửi tới Opus 5.5 được chuyển sang Opus 4.8. Các yêu cầu bị gắn cờ về sinh học hoặc phát triển mô hình tuyến đầu được chuyển sang Opus 5. Cơ chế tương tự được áp dụng cho dòng Sonnet, nhưng mô hình dự phòng là Sonnet 5.

Với Sonnet 5.5, yêu cầu an toàn mạng bị chặn và một nhóm hẹp tác vụ phát triển mô hình ngôn ngữ tuyến đầu có thể được chuyển về Sonnet 5. Ví dụ được nêu gồm công việc nhân xử lý trên một số bộ tăng tốc học máy.

Các yêu cầu bị bộ phân loại chặn vì liên quan đến vũ khí hóa học và sinh học, vũ khí thông thường hoặc chống chưng cất mô hình sẽ kết thúc mà không có mô hình dự phòng. Anthropic cho biết người dùng được thông báo về những lần chặn này thay vì hệ thống âm thầm thay đổi câu trả lời.

Nhà phát triển dùng giao diện lập trình phải tự bật dự phòng

Việc chuyển sang Sonnet 5 phụ thuộc vào nơi Claude được sử dụng. Ứng dụng do Anthropic vận hành tự động chuyển yêu cầu an toàn mạng bị chặn sang mô hình dự phòng. Nhà phát triển dùng giao diện lập trình phải tự bật chức năng này; nếu không, yêu cầu bị chặn sẽ dừng lại.

Các nền tảng và nhà cung cấp khác có thể xử lý yêu cầu bị chặn theo cách riêng. Đội kỹ thuật chuyển từ Sonnet 5 sang Sonnet 5.5 vì thế không nên giả định rằng chỉ cần đổi tên mô hình là hành vi của hệ thống sẽ giữ nguyên.

Chính sách của Anthropic cho phép tìm lỗ hổng trong mã nguồn, nên quy trình lập trình an toàn vẫn hoạt động. Chính sách này chặn việc tìm lỗ hổng trong tệp nhị phân đã biên dịch. Tài liệu hỗ trợ của Anthropic về việc chuyển mô hình cho biết hệ thống kiểm tra mọi nội dung mô hình đọc. Phạm vi kiểm tra gồm bộ nhớ, dữ liệu từ trình kết nối, kết quả tìm kiếm trên mạng và tệp đính kèm.

Kỹ sư kiểm tra dữ liệu mà hệ thống Claude tiếp nhận
Bộ lọc kiểm tra cả dữ liệu từ công cụ.

Nội dung không do người dùng trực tiếp nhập vẫn có thể kích hoạt việc chuyển mô hình. Một tác tử lấy dữ liệu từ kho mã, thông báo an toàn hoặc trang web có thể gặp bộ lọc vì nội dung công cụ trả về. Rủi ro này liên quan trực tiếp đến cách AI làm thay đổi khối lượng công việc của đội bảo mật, nhất là khi hệ thống tự động xử lý nhiều nguồn dữ liệu cùng lúc.

Mô hình dự phòng có thể làm yếu khả năng chống chèn chỉ dẫn

Chuyển sang Sonnet 5 có thể làm thay đổi khả năng chống chèn chỉ dẫn của hệ thống. Trong thử nghiệm môi trường lập trình của Anthropic, một phần yêu cầu gửi tới Sonnet 5.5 được mô hình dự phòng xử lý, và tỷ lệ bị xâm phạm trong nhóm chuyển hướng cao hơn nhóm do Sonnet 5.5 tự xử lý.

Trong thử nghiệm này, 25% yêu cầu gửi tới Sonnet 5.5 đã được Sonnet 5 xử lý sau khi kích hoạt chặn an toàn mạng. Theo The New Stack, nguyên nhân thường là chỉ dẫn chèn vào yêu cầu có nội dung xóa ổ đĩa hoặc xóa tệp, khiến bộ phân loại phản ứng.

Trong số yêu cầu bị chuyển hướng, 12,01% đã bị xâm phạm thành công. Sonnet 5.5 chỉ bị xâm phạm trong bốn trên 5.901 yêu cầu do chính mô hình xử lý. Đây là số liệu từ thử nghiệm của Anthropic được The New Stack thuật lại.

Một bài đánh giá riêng của công ty an toàn AI Gray Swan không ghi nhận suy giảm hiệu quả khi bật mô hình dự phòng. Kết quả khác nhau giữa hai thử nghiệm cho thấy đội triển khai phải đánh giá khả năng bảo vệ của cả Sonnet 5 và Sonnet 5.5 trong môi trường sử dụng thực tế.

Quyền hạn được cấp cho mô hình vẫn là một phần của rủi ro. Khi thiết kế hệ thống, đội vận hành phải xác định AI nên được trao bao nhiêu quyền trong hoạt động an toàn và điều gì xảy ra nếu yêu cầu được chuyển sang một mô hình cũ hơn.

Chuyển mô hình có thể làm lệch cả phiên làm việc

Việc chuyển sang mô hình dự phòng có thể ảnh hưởng cả phiên làm việc thay vì chỉ một yêu cầu. Trường hợp được The New Stack dẫn lại cho thấy phần lớn tin nhắn trong một phiên chuyên về tình báo mối đe dọa đã được mô hình dự phòng tạo ra, và hệ thống không tự quay lại mô hình ban đầu.

Trường hợp Fable 5 cho thấy mức ảnh hưởng đối với quy trình chuyên biệt. The New Stack dẫn báo cáo của một người dùng Claude Code làm tình báo mối đe dọa phòng thủ trên GitHub. Vào ngày sau khi Fable 5 ra mắt trong tháng 6, Opus 4.8 tạo 2.746 trên 3.427 tin nhắn của phiên chính sau các lần chuyển mô hình.

Người dùng này cho biết sau khi phiên làm việc đổi mô hình, hệ thống không tự quay lại Fable 5. Vì vậy, đội vận hành không nên mặc định rằng cơ chế dự phòng chỉ thay đổi một phản hồi đơn lẻ.

Anthropic cho biết họ vẫn đang điều chỉnh bộ phân loại của Sonnet 5.5 để giảm cảnh báo sai. Công ty cũng dự định mở rộng Chương trình xác minh an toàn mạng. Các chuyên gia phòng thủ đã được xác minh sẽ được sử dụng mô hình với ít hạn chế hơn. Sonnet 5.5 chưa có trong chương trình tại thời điểm ra mắt.

Nội dung các đội kỹ thuật cần kiểm tra trước khi chuyển đổi

Trước khi chuyển sang Sonnet 5.5, đội kỹ thuật cần kiểm tra cách nền tảng xử lý yêu cầu bị chặn. Họ cũng cần xác nhận mô hình dự phòng đã được bật hay chưa và mô hình nào tạo từng phản hồi. Quy trình đánh giá phải bao phủ dữ liệu từ bộ nhớ, công cụ, trình kết nối, tìm kiếm và tệp đính kèm.

Sonnet 5.5 có thể đạt kết quả cao hơn trên một số bài đánh giá nhưng vẫn trả về hành vi khác khi lớp an toàn được kích hoạt. Với ứng dụng của Anthropic, việc chuyển sang Sonnet 5 diễn ra tự động. Với giao diện lập trình, đội phát triển phải tự bật chức năng này và quyết định cách xử lý khi yêu cầu dừng lại.

  • Xác nhận nền tảng có tự động chuyển sang Sonnet 5 hay không.
  • Kiểm thử nội dung từ bộ nhớ, trình kết nối, tìm kiếm trên mạng, tệp và công cụ.
  • Đánh giá khả năng chống chèn chỉ dẫn của cả Sonnet 5.5 và Sonnet 5.
  • Ghi lại mô hình thực sự xử lý từng yêu cầu trong nhật ký vận hành.
  • Kiểm tra xem việc chuyển mô hình áp dụng cho một yêu cầu hay tiếp tục trong cả phiên.

Nếu nhật ký không ghi rõ mô hình xử lý từng yêu cầu, đội vận hành có thể gán nhầm chất lượng, lỗi hoặc sự cố an toàn của Sonnet 5 cho Sonnet 5.5.

Hãy theo dõi Sine để cập nhật cách các thay đổi về mô hình, định tuyến và lớp bảo vệ ảnh hưởng đến hệ thống AI đang vận hành thực tế.