Đừng nhầm tưởng, mô hình ngôn ngữ lớn không suy luận

Mô hình ngôn ngữ lớn có thể trình bày lời giải nhiều bước, nhưng theo Thore Graepel, cơ chế đó vẫn khác bộ máy tìm kiếm và kiểm tra từng giúp AlphaGo tạo ra nước đi 37.

Mô hình ngôn ngữ lớn có thể tạo ra lời giải trôi chảy và trình bày nhiều bước, nhưng điều đó chưa chứng minh rằng nó suy luận như AlphaGo. Thore Graepel là thành viên chủ chốt của nhóm AlphaGo tại DeepMind. Theo ông, chatbot vẫn tạo các bước giải thích bằng cơ chế dự đoán đơn vị ngôn ngữ tiếp theo. Chatbot chưa có một bộ máy độc lập để tìm kiếm, kiểm tra bằng chứng và ghi lại trạng thái tri thức.

Trong bài bình luận đăng ngày 2 tháng 10 năm 2026 trên MIT Technology Review, Graepel nhấn mạnh sự khác biệt này. Nó đặc biệt quan trọng trong y tế, kỹ thuật và nghiên cứu khoa học. Một câu trả lời nghe hợp lý là chưa đủ. Con người còn phải kiểm tra được hệ thống đã dùng bằng chứng nào, đưa ra giả định gì và sai ở bước nào.

Nước đi 37 không phải một cú đoán may mắn

Nước đi thứ 37 của AlphaGo trong ván thứ hai với Lee Sedol kết hợp dự đoán với tìm kiếm. Đó không phải một lựa chọn ngẫu nhiên. Hệ thống đã đánh giá nhiều diễn biến có thể xảy ra trước khi chọn nước cờ. Chính mạng dự đoán của AlphaGo xem nước cờ này là rất khó xuất hiện.

Nội dung và kết quả của ván đấu

Theo MIT Technology Review, trận đấu diễn ra tại Seoul vào tháng 3 năm 2016. AlphaGo đặt một quân cờ lên hàng thứ năm trong ván thứ hai của loạt năm ván với Lee Sedol. Nước đi khác thường đến mức một số bình luận viên cho rằng chương trình gặp lỗi. AlphaGo sau đó thắng ván đấu và khép lại loạt trận với tỷ số 4-1. Đối thủ của hệ thống là Lee Sedol, một trong những kỳ thủ cờ vây chuyên nghiệp xuất sắc nhất mọi thời đại.

Theo lời Lee Sedol được Graepel dẫn lại, ông từng nghĩ AlphaGo chỉ là một cỗ máy dựa trên tính toán xác suất. Sau khi chứng kiến nước đi ấy, ông cho rằng AlphaGo có khả năng sáng tạo.

Vì sao cờ vây đòi hỏi cách tìm kiếm khác

Trước đó, Deep Blue đã đánh bại đương kim vô địch cờ vua thế giới Garry Kasparov vào năm 1997. Theo số liệu Graepel nêu, hệ thống xem trước từ sáu đến tám nước cho mỗi bên. Nó đánh giá 200 triệu thế cờ mỗi giây bằng các quy tắc do con người lập trình.

Cờ vây phức tạp hơn nhiều. Giá trị của một quân cờ phụ thuộc vào cách các nhóm quân và lãnh thổ phát triển qua hàng chục nước tiếp theo. Graepel cho rằng ngay cả việc tính một phần nhỏ số kết quả có thể xảy ra cũng khiến siêu máy tính mất hàng tỷ năm. AlphaGo vì thế không thể chỉ vét cạn mọi khả năng.

AlphaGo kết hợp trực giác và tìm kiếm

AlphaGo dùng mạng chính sách để đề xuất nước đi và dùng cây tìm kiếm để kiểm tra hậu quả của các lựa chọn đó. Hai thành phần đảm nhận hai nhiệm vụ riêng: mạng nơron thu hẹp không gian lựa chọn, còn quá trình tìm kiếm đánh giá các diễn biến tiếp theo trước khi hệ thống quyết định.

Mạng chính sách được huấn luyện để dự đoán nước đi mà một kỳ thủ mạnh có thể chọn. Phần mang tính trực giác này đánh giá nước đi 37 là rất khó xảy ra. Theo số liệu Graepel nêu, xác suất một kỳ thủ chuyên nghiệp chọn nước đi đó chỉ khoảng một trên 10.000.

AlphaGo vẫn chọn nước đi 37 nhờ bộ máy tìm kiếm. Hệ thống không dừng ở việc xác định nước cờ nào có vẻ hợp lý trong thế trận hiện tại. Nó xây dựng cây trò chơi gồm hàng nghìn nhánh, mỗi nhánh đại diện cho một diễn biến có thể xảy ra, rồi cân nhắc hậu quả của từng nước đi và nước đáp trả.

Cách vận hành này gần với sự phân chia giữa hai kiểu tư duy do Daniel Kahneman phổ biến. Hệ thống 1 phản ứng nhanh, dựa trên liên tưởng và trực giác. Hệ thống 2 chậm hơn, diễn ra từng bước và có sự cân nhắc. Trong AlphaGo, mạng nơron đưa ra đánh giá ban đầu về nước đi hoặc thế trận, còn quá trình tìm kiếm kiểm tra đánh giá đó trước các diễn biến tiếp theo.

Chỉ trực giác sẽ không chọn nước đi 37. Chỉ tìm kiếm vét cạn cũng khó xử lý số lượng nước cờ khổng lồ. Kết quả xuất hiện khi hai cơ chế đảm nhận hai nhiệm vụ khác nhau.

Mô hình ngôn ngữ lớn vẫn dự đoán từ tiếp theo

Mô hình ngôn ngữ lớn tạo phản hồi bằng cách liên tục dự đoán đơn vị ngôn ngữ tiếp theo từ chuỗi đã có. Việc mô hình viết ra các bước trung gian có thể cải thiện kết quả, nhưng theo Graepel, các bước đó vẫn đến từ cùng một cơ chế dự đoán chứ chưa tạo thành bộ máy tìm kiếm độc lập như AlphaGo.

Cơ chế dự đoán này gần với Hệ thống 1: nhanh, giàu liên tưởng và có khả năng hoàn thiện mẫu trên nhiều chủ đề mà con người từng viết.

Sau khi ChatGPT xuất hiện, giới phát triển sớm nhận ra rằng sự lưu loát chưa đủ để tạo ra một công cụ đáng tin cậy. Các mô hình mới vì thế được cho phép tạo những bước trung gian, chia nhỏ vấn đề, giữ lại kết quả từng phần và dùng chúng để tác động đến câu trả lời sau cùng. Cách làm này thường được gọi là chuỗi suy nghĩ và đã đem lại tiến bộ rõ rệt trong toán học cùng lập trình.

Tuy nhiên, theo Graepel, chuỗi suy nghĩ không bổ sung một bộ máy suy luận độc lập giống quá trình tìm kiếm của AlphaGo. Những bước trung gian vẫn do cùng cơ chế dự đoán đơn vị ngôn ngữ tiếp theo tạo ra. Mô hình lặp cơ chế đó lâu hơn trước khi đưa ra đáp án.

Khác biệt này cũng cần được xem xét khi đánh giá cách tác tử lập trình bằng trí tuệ nhân tạo hoạt động. Việc một hệ thống có thể viết mã, gọi công cụ hoặc trình bày nhiều bước không tự động chứng minh rằng nó đang duy trì một tiến trình suy luận có thể kiểm toán.

Ba thiếu sót của chuỗi suy nghĩ

Theo Graepel, chuỗi suy nghĩ còn thiếu ba đặc điểm của một cơ chế suy luận có thể kiểm tra. Đó là trạng thái tri thức bền vững, sự tách biệt giữa kiến thức và cách xử lý kiến thức, cùng hồ sơ đáng tin cậy về con đường dẫn đến đáp án.

  1. Mô hình thường không duy trì một trạng thái tri thức rõ ràng, bền vững và có thể kiểm tra. Không có sổ ghi chép công khai về các giả thuyết hệ thống đang cân nhắc hoặc mức độ tin cậy của từng cách giải thích. Hệ thống cũng không ghi rõ bằng chứng đang dùng và những câu hỏi chưa được giải quyết.

  2. Kiến thức và cách xử lý kiến thức không được tách biệt. Cả hai đan vào nhau trong trọng số của mạng nơron, thay vì tồn tại dưới dạng một tập hợp niềm tin được biểu diễn độc lập.

  3. Chuỗi suy nghĩ có thể trông giống quá trình cân nhắc. Tuy nhiên, các nghiên cứu được Graepel dẫn lại cho thấy chatbot đôi khi dựng phần giải thích sau khi đã có đáp án. Hệ thống có thể đi đến kết quả bằng một đường nhưng kể lại một đường khác.

Vì sao các thiếu sót này gây rủi ro

Vấn đề không chỉ nằm ở thuật ngữ. Trong y khoa, kỹ thuật hoặc nghiên cứu khoa học, người dùng cần xác định nguồn gốc của lỗi. Lỗi có thể đến từ phép suy luận, bằng chứng không hợp lệ hoặc một giả định sai. Một lời giải thích được tạo sau sự việc không cung cấp khả năng kiểm tra đó.

Rủi ro tương tự xuất hiện khi hệ thống tự thực hiện nhiều hành động. Cuộc tranh luận về mức quyền nên trao cho trí tuệ nhân tạo vì thế không thể chỉ dựa vào độ trôi chảy của câu trả lời. Quyền hành động càng lớn, nhu cầu theo dõi bằng chứng và quyết định càng cao.

Một bộ máy suy luận cần ghi lại điều nó biết

Một bộ máy suy luận có thể kiểm toán phải ghi lại điều đã được xác lập, điều còn bị nghi ngờ, những khả năng đã bị loại trừ và các câu hỏi chưa có lời giải. Cấu trúc đó cho phép hệ thống cập nhật trạng thái tri thức theo bằng chứng, thay vì chỉ tạo một chuỗi giải thích nghe hợp lý.

Cây trò chơi lưu lại trạng thái suy luận

Graepel cho biết ông rời vị trí tại Google DeepMind vì tin rằng suy luận máy cần một hướng tiếp cận mới dựa trên kiến trúc của AlphaGo. Trong mỗi thế cờ, AlphaGo duy trì cây trò chơi như một hồ sơ về những gì nó đã xem xét. Cấu trúc này lưu các biến thể và tương lai có thể xảy ra. Nó cũng gắn đánh giá của mạng nơron với từng nước đi và vị trí.

Khi quá trình tìm kiếm tiếp tục, AlphaGo cập nhật cây trò chơi rồi tổng hợp thông tin trong đó để chọn nước đi. Với một hệ thống suy luận tổng quát, cấu trúc tương đương phải thể hiện điều gì đã được xác lập, điều gì còn bị nghi ngờ, khả năng nào đã bị loại trừ và câu hỏi nào vẫn để ngỏ.

Trạng thái tri thức thay đổi theo bằng chứng

Khi ấy, suy luận có thể được xem như chuỗi hành động làm thay đổi trạng thái tri thức nhằm giảm bất định. Hệ thống có thể suy ra hệ quả và chia vấn đề thành các phần. Sau đó, nó chọn câu hỏi tiếp theo, thực hiện phép tính hoặc quyết định thí nghiệm cần tiến hành.

Việc này khó hơn chơi cờ. Trong thế giới thực, trạng thái hiện tại chỉ được biết một phần, số hành động khả dụng lớn và thay đổi liên tục, còn hậu quả có thể mang tính ngẫu nhiên hoặc chưa biết. Đây cũng là lý do hạ tầng và quyền truy cập phải được thiết kế cẩn thận khi tác tử trí tuệ nhân tạo vận hành trên Kubernetes.

Mô hình ngôn ngữ vẫn có vai trò trong hệ thống mới

Lập luận của Graepel không loại bỏ vai trò của mô hình ngôn ngữ lớn. Mô hình vẫn có thể đề xuất cách xử lý vấn đề, sử dụng công cụ và hỗ trợ đánh giá tuyên bố. Điểm còn thiếu là một thành phần độc lập có nhiệm vụ kiểm tra từng bước, quản lý bằng chứng và chỉ cập nhật niềm tin khi có cơ sở.

Những tiến bộ gần đây cho phép mô hình ngôn ngữ đề xuất cách xử lý vấn đề dựa trên kiến thức và nguồn lực sẵn có. Chúng cũng có thể tương tác với công cụ qua giao diện lập trình hoặc mã, rồi hỗ trợ đánh giá một tuyên bố có được bằng chứng hiện tại hậu thuẫn hay không.

Điểm quyết định là phải có một thành phần độc lập đánh giá từng bước theo mức độ nó thực sự làm giảm bất định. Hệ thống chỉ được cập nhật niềm tin khi thay đổi đó có bằng chứng hỗ trợ. Nếu các quy tắc này được thực thi, máy có thể tích lũy kiến thức đã được xác nhận và cải thiện chính sách suy luận từ những lần giải quyết vấn đề trước.

Cách tiếp cận ấy gần với một phương pháp khoa học được tăng tốc bằng máy tính. Mục tiêu là tạo ra kiến thức chịu được sự kiểm tra, thay vì tạo ra câu chuyện thuyết phục nhất.

Mở rộng quy mô không biến trực giác thành suy luận

Theo Graepel, việc làm mô hình dự đoán lớn hơn có thể cải thiện trực giác thống kê nhưng không tự tạo ra cơ chế cân nhắc độc lập. Một hệ thống đáng tin cậy còn phải theo dõi trạng thái, kiểm tra các khả năng, ghi lại bằng chứng và cho phép con người xác định lỗi xuất hiện ở đâu.

Nước đi 37 có ý nghĩa vì AlphaGo giữ lại trạng thái của ván cờ, cân nhắc những tương lai có thể xảy ra và chọn nước đi mà phần trực giác của chính nó đánh giá là khó xuất hiện. Những lĩnh vực như khám phá thuốc, vật liệu, khí hậu và chẩn đoán cũng cần các phát hiện sáng tạo như vậy, dù bài toán thực tế không có bàn cờ hay bộ quy tắc được trao sẵn.

Muốn đạt đến đó, kết luận của máy phải xuất phát từ một chuỗi bằng chứng, suy diễn và điều chỉnh niềm tin có thể kiểm toán. Một lời giải thích nghe hợp lý sau khi đáp án đã xuất hiện không thể thay thế cơ chế ấy.

Thore Graepel là chủ nhiệm ngành học máy tại University College London, từng là thành viên chủ chốt của nhóm AlphaGo tại DeepMind và nghiên cứu cách bảo đảm trí tuệ nhân tạo phục vụ sự phát triển của con người.

Hãy tiếp tục theo dõi Sine để nhìn rõ cơ chế phía sau những tuyên bố lớn về năng lực suy luận của trí tuệ nhân tạo.