Reactive Diffusion Policy: 계획은 길게, 접촉 반응은 빠르게
큰 동작을 계획하는 시간과 손끝의 변화에 대응하는 시간을 나누면 무엇이 달라질까요?
INTERACT ROBOTICS · 논문 리뷰 · 자료 검토 2026.09.07
이미 정한 동작 중에도 접촉은 변합니다
여러 시점의 행동을 한 번에 생성하는 정책은 부드러운 동작을 만들기 좋습니다. 하지만 그 동작을 실행하는 동안 물체가 움직이거나 접촉이 달라질 수 있습니다. Reactive Diffusion Policy(RDP)는 느린 시각 기반 계획과 빠른 촉각·힘 반응을 결합하는 구조를 제안합니다.
교란을 언제 주었는지가 중요합니다
논문의 peeling 작업에서 접촉 후 교란 조건의 점수는 DP 0.19, RDP의 힘 입력 구성 0.88로 보고됩니다. 이것은 모든 작업의 평균 성공률이 아니라 해당 작업·조건의 평가 점수입니다. 광학 촉각 센서를 사용한 구성과 힘 센서 구성의 결과도 구분해야 합니다.
장치와 학습이 함께 결정하는 반응성
신호를 빠르게 읽는 센서만으로 반응이 빨라지지는 않습니다. 통신, 전처리, 정책 추론과 로봇 제어까지 지연이 누적됩니다. 우리에게 필요한 평가는 센서 주기 하나가 아니라 접촉 변화에서 행동 보정까지 걸리는 전체 시간입니다.
속도만의 문제가 아닙니다
빠른 보정이 큰 동작 계획을 방해하지 않는지, 노이즈에 과도하게 반응하지 않는지도 확인해야 합니다. 접촉 전 접근과 접촉 후 추종을 나누어 실패를 분석하면 어느 계층을 개선해야 하는지 더 분명해집니다.
참고 자료
- Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation ↗
2025 · Table II, Peeling · contact 이후 교란 조건. 0.19와 0.88은 이 표의 작업 성능 점수입니다.