ManipForce: 영상 사이의 힘을 놓치지 않는 학습
이규빈 교수 연구팀의 FMT는 서로 다른 속도로 들어오는 영상과 힘을 어떻게 함께 다룰까요?
INTERACT ROBOTICS · 논문 리뷰 · 자료 검토 2026.09.07
영상과 힘은 같은 속도로 변하지 않습니다
ManipForce는 30Hz RGB와 200Hz 힘·토크를 다루는 Force-aware Multimodal Transformer(FMT)를 제안합니다. 주파수와 모달리티 정보를 표현하고 양방향 교차 어텐션으로 연결해 diffusion policy의 행동 예측에 활용합니다. 영상 인코더를 없앤 연구가 아니라, 서로 다른 시간 해상도의 시각과 힘을 결합한 연구입니다.
작업별 성공률
| 작업 | RGB-only | FMT |
|---|---|---|
| 기어 조립 | 35% | 95% |
| LAN 플러그 삽입 | 40% | 85% |
| 상자 뒤집기 | 5% | 90% |
| 뚜껑 열기 | 20% | 100% |
| 배터리 분해 | 20% | 65% |
| 배터리 삽입 | 10% | 60% |
원논문 Table I · 작업당 20회 평가. 여섯 작업의 단순 평균은 21.7%와 82.5%입니다. IR의 약 22%·83%는 반올림값입니다. 외부 연구 결과입니다.
읽어야 할 것은 평균 뒤의 차이
기어 조립에서의 높은 성공률과 배터리 삽입에서 남은 실패는 서로 다른 과제를 가리킵니다. 힘을 관측하는 것만으로 모든 접촉 문제를 해결했다고 볼 수는 없습니다. 어떤 접촉 상태가 구분 가능해졌는지와 실패 유형이 어떻게 바뀌었는지를 함께 읽어야 합니다.
취득 시스템에 주는 시사점
모든 센서를 영상 프레임에 맞춰 먼저 줄이면 학습 방법이 선택할 수 있는 정보도 줄어듭니다. 우리는 원래의 힘 이력과 시간 정보를 남기고, 어떤 대역과 시간창이 작업에 필요한지 평가하는 방향을 택합니다. 작업자가 저항에 반응한 동작을 같은 시간축에 연결하는 것도 이 문제의 연장입니다.
참고 자료
- ManipForce: Force-Guided Policy Learning with Frequency-Aware Representation for Contact-Rich Manipulation ↗
Geonhyup Lee 외, Kyoobin Lee · 2025 · Table I. FMT의 외부 연구 결과와 당사의 개발 방향을 구분합니다.