Trong tài liệu về robot học máy, chính sách là khái niệm trung tâm. Nó không phải thuật ngữ quản trị mà là tên gọi cho thứ quyết định robot làm gì tại mỗi thời điểm.
Định nghĩa gọn nhất
Chính sách là một hàm: đưa vào quan sát, trả ra hành động.
Quan sát là những gì robot biết tại thời điểm đó: ảnh từ camera, góc các khớp, lực đo được ở cổ tay, đôi khi cả câu lệnh bằng ngôn ngữ.
Hành động là những gì robot làm ngay sau đó: vị trí đích cho các khớp, vận tốc mong muốn, hoặc lệnh đóng mở tay kẹp.
Robot chạy bằng cách lặp vòng này liên tục: quan sát, tính hành động, thực hiện, quan sát lại. Chính sách chính là phần tính ở giữa.
Hai cách huấn luyện chính
Học bắt chước. Cho chính sách xem nhiều ví dụ do người làm mẫu, mỗi ví dụ gồm quan sát và hành động tương ứng. Chính sách học cách sao chép. Cách này đơn giản, ổn định và là cách phổ biến nhất trong thao tác vật thể.
Học bằng thử sai. Cho chính sách tự hành động, chấm điểm kết quả, rồi điều chỉnh để tăng điểm. Cách này không cần người làm mẫu và có thể tìm ra giải pháp con người không nghĩ tới, nhưng cần rất nhiều lần thử — nên hầu như luôn phải chạy trong mô phỏng.
Nhiều hệ thống kết hợp: bắt chước trước để có một chính sách biết làm ở mức cơ bản, sau đó cải thiện bằng thử sai.
Vấn đề lệch phân bố
Đây là khó khăn kinh điển của học bắt chước, và hiểu nó giải thích nhiều thất bại thực tế.
Chính sách chỉ học từ những trạng thái mà người làm mẫu đã đi qua. Nhưng khi chạy thật, nó mắc một lỗi nhỏ và rơi vào trạng thái hơi khác. Ở trạng thái đó nó chưa từng thấy dữ liệu, nên hành động lại kém hơn, dẫn tới trạng thái còn lạ hơn.
Sai lệch tích luỹ và robot đi lạc khỏi vùng nó biết. Biểu hiện điển hình: robot làm tốt vài giây đầu rồi hành xử ngày càng kỳ lạ.
Cách khắc phục thường dùng: thu thêm dữ liệu ở chính các trạng thái mà chính sách gặp phải khi chạy, thường bằng cách để người can thiệp sửa chữa giữa chừng và ghi lại các lần sửa đó.
Chính sách nhận vào gì thì quan trọng không kém
Thiết kế phần quan sát ảnh hưởng tới kết quả nhiều hơn người mới thường nghĩ.
- Số góc camera. Một camera nhìn từ trên và một camera gắn trên cổ tay cho thông tin bổ sung nhau; nhiều hệ thống dùng cả hai.
- Trạng thái bản thân robot. Không có thông tin về góc khớp, chính sách khó biết mình đang ở đâu.
- Cảm biến lực. Với thao tác cần tiếp xúc, thiếu lực thì chính sách gần như mù ở giai đoạn quan trọng nhất.
- Lịch sử vài bước gần nhất, giúp phân biệt các tình huống trông giống nhau nhưng đang ở giai đoạn khác của thao tác.
Thêm dữ liệu đầu vào không phải lúc nào cũng tốt: mỗi kênh thêm vào đều làm bài toán học khó hơn và cần nhiều dữ liệu hơn.
Đánh giá một chính sách cho đúng
Đây là chỗ dễ tự lừa mình nhất. Ba nguyên tắc.
Đánh giá trên tình huống chưa từng huấn luyện. Vật mới, vị trí mới, ánh sáng mới. Kết quả trên chính dữ liệu đã học không nói lên điều gì.
Đủ số lần thử. Mười lần thử không phân biệt được tỉ lệ thành công bảy phần mười với chín phần mười.
Ghi lại kiểu thất bại, không chỉ tỉ lệ. Trượt tay khác với đâm vào bàn khác với đứng im không làm gì. Ba kiểu này dẫn tới ba hướng khắc phục hoàn toàn khác nhau.
Một chính sách có tỉ lệ thành công thấp nhưng thất bại theo cách an toàn và đoán trước được thường hữu ích hơn một chính sách tỉ lệ cao hơn nhưng thỉnh thoảng làm điều nguy hiểm.
Câu hỏi thường gặp
Chính sách và mô hình có phải một không?
Chính sách là vai trò, mô hình là cách hiện thực hoá. Chính sách nói về chức năng ánh xạ quan sát sang hành động; mô hình mạng học sâu là công cụ phổ biến để thực hiện chức năng đó, nhưng về nguyên tắc một bảng tra cứu cũng có thể là một chính sách.
Vì sao học bắt chước lại phổ biến hơn học thử sai trong thao tác?
Vì thao tác vật thể khó định nghĩa hàm chấm điểm cho đúng, và số lần thử cần thiết rất lớn. Học bắt chước tận dụng được kỹ năng sẵn có của con người và cho kết quả dùng được với lượng dữ liệu nhỏ hơn nhiều.
Làm sao thu được dữ liệu làm mẫu chất lượng?
Thường bằng điều khiển từ xa với thiết bị cho phép người thao tác tự nhiên, và bằng cách để người làm mẫu thực hiện nhiệm vụ với đủ đa dạng về vị trí vật, ánh sáng và tình huống. Dữ liệu chỉ lặp lại một kịch bản hoàn hảo sẽ tạo ra chính sách rất giòn.
Chính sách có chạy được trên thân máy khác không?
Không tự động, vì hành động được biểu diễn theo cấu trúc của thân máy đã huấn luyện. Có các hướng nghiên cứu về chính sách dùng chung cho nhiều thân máy, nhưng trong thực tế triển khai hiện nay thường vẫn phải huấn luyện lại hoặc tinh chỉnh cho từng máy.
Đọc thêm trong Nền tảng & bộ công cụ và Dữ liệu thao tác & điều khiển từ xa.