RobotHienThan.comRobot Hiện Thân
Robot hiện thân là gì

Vì sao mô hình ngôn ngữ không tự biến thành robot

Một mô hình mô tả cách pha cà phê rất trôi chảy vẫn không điều khiển nổi một cánh tay. Khoảng cách nằm ở bốn thứ mà văn bản không chứa.

Màn hình hiển thị đoạn hướng dẫn bằng chữ đặt cạnh một cánh tay robot đang đứng yên

Mô hình ngôn ngữ hiện nay mô tả được quy trình pha cà phê, liệt kê được dụng cụ, giải thích được vì sao nước quá nóng làm cháy bột. Nhưng đưa nó vào một cánh tay robot thì cánh tay đó vẫn không pha nổi một ly. Khoảng cách này rất đáng hiểu rõ.

Thứ nhất: văn bản không chứa hình thể máy

Để điều khiển, hệ thống cần biết cánh tay dài bao nhiêu, khớp quay được tới đâu, tay kẹp mở rộng bao nhiêu, đầu công tác nằm cách mặt bích bao xa.

Không có thông tin nào trong số này nằm trong văn bản trên mạng. Chúng đặc thù cho từng thân máy, và đổi tay kẹp là chúng đổi theo.

Vì vậy mọi hệ thống thực tế đều cần một lớp riêng biết về thân máy: mô hình động học, giới hạn khớp, giới hạn tốc độ. Lớp này không học từ văn bản mà được mô tả trực tiếp.

Thứ hai: hành động cần phản hồi liên tục

Sinh văn bản là quá trình một chiều: mô hình xuất ra chữ, không cần biết thế giới phản ứng thế nào.

Hành động thì ngược lại. Robot đưa tay xuống, chạm vào vật, cảm nhận phản lực, điều chỉnh, thử lại. Vòng lặp này diễn ra rất nhanh và liên tục.

Đây là ràng buộc kỹ thuật khắt khe. Vòng điều khiển chuyển động thường phải chạy hàng trăm lần mỗi giây, trong khi một mô hình lớn cần thời gian đáng kể cho mỗi lần suy luận. Hai nhịp này lệch nhau nhiều bậc.

Cách xử lý phổ biến là phân tầng: mô hình lớn chạy chậm ở tầng trên để quyết định làm gì, còn tầng dưới chạy nhanh lo phần bám quỹ đạo và phản ứng với lực.

Thứ ba: hệ quả vật lý không đảo ngược được

Trong sinh văn bản, một câu sai có thể sửa lại. Trong thao tác vật lý, một cú va làm vỡ vật thì không có nút hoàn tác.

Điều này đổi hẳn cách thiết kế hệ thống. Không thể để mô hình thử nhiều phương án rồi chọn phương án tốt nhất trên máy thật, vì mỗi lần thử là một hành động có hậu quả.

Do đó phần lớn việc thử nghiệm được chuyển vào mô phỏng, và trên máy thật phải có các lớp bảo vệ độc lập với mô hình: giới hạn lực, giới hạn không gian, phát hiện va chạm. Các lớp này không do mô hình quyết định.

Thứ tư: tri thức ngầm không được viết ra

Con người biết cầm quả trứng nhẹ hơn cầm cục gạch, biết nghiêng ly bao nhiêu thì nước tràn, biết khi nào một chi tiết đã vào khớp. Không ai viết những điều đó thành văn bản vì chúng quá hiển nhiên.

Đây chính là loại tri thức robot cần nhất và lại thiếu nhất trong dữ liệu văn bản.

Vì vậy nguồn dữ liệu quan trọng cho robot không phải văn bản mà là bản ghi thao tác: quan sát của cảm biến kèm hành động tương ứng, thu từ người điều khiển robot hoặc từ mô phỏng. Đây là loại dữ liệu đắt và chậm, và cũng là nút thắt lớn nhất của lĩnh vực.

Vậy mô hình ngôn ngữ đóng vai trò gì

Vai trò của nó thật ra rất lớn, chỉ là không nằm ở tầng điều khiển.

  • Hiểu yêu cầu của người phát biểu bằng ngôn ngữ tự nhiên, kể cả khi mơ hồ.
  • Chia nhiệm vụ lớn thành các bước mà tầng dưới thực hiện được.
  • Tri thức chung về thế giới: cốc thường đặt trên bàn, dao thì sắc, chất lỏng thì đổ.
  • Gắn ngôn ngữ với đối tượng nhìn thấy, giúp robot biết chiếc cốc nào đang được nhắc tới.

Kiến trúc phổ biến hiện nay tận dụng đúng các thế mạnh này: mô hình lớn ở tầng lập kế hoạch và nhận biết, một mô hình chuyên biệt sinh hành động, và một tầng điều khiển cổ điển đảm bảo chuyển động an toàn và mượt.

Câu hỏi thường gặp

Có thể huấn luyện mô hình ngôn ngữ trên dữ liệu robot không?

Có, và đây chính là hướng của các mô hình thị giác – ngôn ngữ – hành động. Chúng lấy một mô hình đã học tri thức chung từ ảnh và văn bản, rồi huấn luyện tiếp trên dữ liệu thao tác để nó sinh ra hành động. Tri thức nền giúp mô hình tổng quát hoá tốt hơn so với huấn luyện từ đầu chỉ bằng dữ liệu robot.

Vì sao không cho mô hình lớn chạy trực tiếp vòng điều khiển?

Vì tốc độ suy luận không đáp ứng được yêu cầu về tần số của vòng điều khiển chuyển động, và vì độ trễ không ổn định sẽ làm hệ mất ổn định. Kiến trúc phân tầng giải quyết việc này bằng cách để mô hình lớn ra quyết định ở nhịp chậm hơn.

Mô phỏng có thay được dữ liệu thật không?

Thay được một phần, đặc biệt cho các kỹ năng vận động và cho việc học trong môi trường có thể mô tả bằng vật lý. Nhưng những gì mô phỏng mô tả kém — ma sát, vật biến dạng, tiếp xúc phức tạp — vẫn cần dữ liệu thật để bổ sung.

Robot cần bao nhiêu dữ liệu thao tác để học một kỹ năng?

Không có con số chung; nó phụ thuộc vào độ khó của kỹ năng, mức đa dạng của môi trường và việc mô hình đã được huấn luyện trước hay chưa. Xu hướng chung là mô hình có tri thức nền tốt cần ít dữ liệu chuyên biệt hơn đáng kể so với huấn luyện từ đầu.

Đọc thêm trong Huấn luyện trong mô phỏngThao tác vật thể.

Need specific advice for your case?

We will contact you within 24 hours.

Request consultation now

Need advice? Talk to us

Leave your details and our team will contact you within 24 hours. The first consultation is completely free.

or
Call now +84 926 138 138