RobotHienThan.comRobot Hiện Thân
Sim2real: từ mô phỏng ra máy thật

Tinh chỉnh trên máy thật: làm ít mà đúng chỗ

Dữ liệu thật đắt, nên phải dùng đúng chỗ. Nguyên tắc là chỉ thu dữ liệu ở những tình huống mà mô phỏng mô tả sai nhất.

Người vận hành can thiệp sửa thao tác cho robot đang chạy chính sách mới

Sau khi chính sách học xong trong mô phỏng, bước tiếp theo không phải là thu thật nhiều dữ liệu thật. Mỗi mẫu dữ liệu thật tốn thời gian và công sức, nên câu hỏi đúng là thu ở đâu để có tác dụng lớn nhất.

Nguyên tắc: thu ở nơi mô phỏng sai nhất

Chính sách đã học được phần lớn kỹ năng trong mô phỏng. Phần nó thiếu chỉ nằm ở những chỗ mô phỏng mô tả không đúng.

Với thao tác vật thể, những chỗ đó gần như luôn là giai đoạn tiếp xúc: khoảnh khắc tay kẹp chạm vào vật, siết lại, nhấc lên, và khi vật trượt trong tay.

Giai đoạn di chuyển trong không gian trống thì mô phỏng mô tả khá đúng, nên thu dữ liệu ở đó ít giá trị.

Hệ quả thực tế: thay vì ghi lại toàn bộ nhiệm vụ từ đầu tới cuối, nên tập trung ghi các đoạn ngắn quanh thời điểm tiếp xúc, với nhiều biến thể về vị trí và hướng vật.

Thu dữ liệu bằng can thiệp

Một cách hiệu quả là để chính sách chạy và người sẵn sàng sửa khi nó sắp sai.

Khi người can thiệp, hệ thống ghi lại cả trạng thái lúc đó lẫn hành động đúng mà người đã thực hiện. Đây chính là dữ liệu quý nhất: nó nằm đúng ở các trạng thái mà chính sách gặp khó, chứ không phải các trạng thái người tự chọn.

Cách này cũng giải quyết được vấn đề lệch phân bố của học bắt chước: dữ liệu được thu tại chính những trạng thái mà chính sách dẫn tới, không phải trạng thái lý tưởng.

Yêu cầu kỹ thuật: cần cơ chế chuyển quyền điều khiển mượt mà và an toàn, cùng với việc đánh dấu rõ đoạn nào do người làm, đoạn nào do chính sách.

Bao nhiêu dữ liệu là đủ

Ít hơn nhiều so với huấn luyện từ đầu, nhưng con số cụ thể phụ thuộc vào mức độ sai của mô phỏng và độ khó của nhiệm vụ.

Cách làm thực tế là tăng dần và đo: thu một lượng nhỏ, tinh chỉnh, đo tỉ lệ thành công trên tập kiểm thử cố định, rồi lặp lại. Vẽ đường cong tỉ lệ thành công theo lượng dữ liệu.

Khi đường cong bắt đầu phẳng, thu thêm dữ liệu cùng loại không còn giúp gì. Lúc đó nếu tỉ lệ vẫn chưa đạt, vấn đề nằm ở chỗ khác — thường là ở phần cứng, ở thiết kế tay kẹp hoặc ở việc thiếu một kênh cảm biến.

Đường cong này cũng là công cụ ra quyết định tốt: nó cho biết nên tiếp tục thu dữ liệu hay nên đổi hướng.

Rủi ro quên kiến thức cũ

Tinh chỉnh trên một tập dữ liệu hẹp có thể làm chính sách mất đi những gì đã học trước đó.

Biểu hiện: chính sách làm rất tốt đúng tình huống vừa được tinh chỉnh, nhưng kém đi ở các tình huống khác vốn đã ổn.

Ba cách giảm thiểu, thường dùng kết hợp.

  • Trộn dữ liệu. Khi tinh chỉnh, vẫn giữ một phần dữ liệu mô phỏng trong mỗi lô huấn luyện.
  • Học chậm. Dùng tốc độ học nhỏ hơn nhiều so với giai đoạn huấn luyện chính.
  • Đóng băng một phần mô hình, chỉ cập nhật các lớp gần đầu ra.

Quan trọng không kém: luôn đo lại trên toàn bộ tập kiểm thử sau khi tinh chỉnh, không chỉ trên các tình huống vừa bổ sung.

Kiểm chứng trước khi triển khai

Một chính sách vừa tinh chỉnh không nên đưa thẳng vào chạy sản xuất. Ba lớp kiểm tra theo thứ tự.

Trong mô phỏng: chạy qua tập tình huống khó để phát hiện hành vi bất thường mà không tốn phần cứng.

Trên máy thật, tốc độ thấp, có người giám sát: đủ số lần thử để ước lượng được tỉ lệ thành công, và ghi lại phân loại kiểu thất bại.

Chạy thử song song: cho chính sách mới chạy trong một phần nhỏ chu kỳ trong khi phần lớn vẫn dùng bản cũ, so sánh trực tiếp trên cùng điều kiện.

Lớp cuối tốn công thiết lập nhưng cho kết quả đáng tin nhất, vì nó loại bỏ được ảnh hưởng của các yếu tố thay đổi theo ngày như nhiệt độ, lô vật tư hay ánh sáng.

Câu hỏi thường gặp

Có nên tinh chỉnh liên tục khi trạm đang chạy không?

Rất rủi ro nếu không có quy trình kiểm chứng. Cập nhật liên tục khiến hành vi thay đổi mà không ai kiểm soát, và khó truy nguyên khi có sự cố. Cách an toàn hơn là thu dữ liệu liên tục nhưng cập nhật theo phiên bản có kiểm chứng.

Dữ liệu can thiệp có cần nhiều không?

Thường ít hơn nhiều so với dữ liệu làm mẫu thông thường, vì nó nằm đúng ở các trạng thái khó. Điểm quan trọng là phủ được các dạng thất bại khác nhau chứ không phải số lượng, nên nên phân loại thất bại trước rồi thu có chủ đích.

Làm sao biết chính sách đã quên kiến thức cũ?

Bằng cách giữ một tập kiểm thử cố định gồm cả các tình huống cũ và chạy lại toàn bộ sau mỗi lần tinh chỉnh. Nếu tỉ lệ thành công ở nhóm cũ giảm trong khi nhóm mới tăng, đó chính là hiện tượng quên.

Tinh chỉnh có cần huấn luyện lại từ đầu không?

Không, đó chính là điểm của tinh chỉnh: giữ nguyên trọng số đã học và chỉ cập nhật nhẹ bằng dữ liệu mới. Huấn luyện lại từ đầu tốn kém hơn nhiều và thường không cho kết quả tốt hơn nếu lượng dữ liệu thật còn nhỏ.

Đọc thêm trong Thao tác vật thểHuấn luyện trong mô phỏng.

Need specific advice for your case?

We will contact you within 24 hours.

Request consultation now

Need advice? Talk to us

Leave your details and our team will contact you within 24 hours. The first consultation is completely free.

or
Call now +84 926 138 138