ForceVLA: 힘을 넣는 것과 힘을 쓰는 것
힘 신호를 단순히 추가하는 방식과, 행동 생성 과정에서 융합하는 방식의 차이를 읽습니다.
INTERACT ROBOTICS · 논문 리뷰 · 자료 검토 2026.09.07
연구의 질문
VLA가 영상과 언어로 작업을 이해하더라도, 접촉 이후의 작은 저항 변화는 별도의 관측이 필요할 수 있습니다. ForceVLA는 힘·토크를 행동 생성에 연결하는 force-aware mixture-of-experts 모듈을 제안합니다.
같은 논문 안의 비교
| 조건 | 5개 작업 평균 성공률 |
|---|---|
| π0-base · 힘 입력 없음 | 37.3% |
| π0-base · 힘 입력 단순 추가 | 40.2% |
| ForceVLA · FVLMoE 융합 | 60.5% |
ForceVLA v3, §5.2. 37.3%→60.5%는 23.2%p 차이입니다. 외부 연구 결과이며 최신 π0.7과의 비교나 당사 성과가 아닙니다.
센서보다 표현과 결합이 중요합니다
단순한 힘 입력 추가보다 제안된 융합 방식의 개선 폭이 컸다는 점이 핵심입니다. 신호가 존재해도 정책이 작업의 어느 시점에 그것을 활용할지 배우지 못하면 효과가 제한될 수 있습니다.
우리의 관점에서는 데이터 취득과 학습 구조를 함께 설계해야 한다는 근거로 읽힙니다. 방향·좌표계·시간 이력을 보존한 힘을 만들고, 접촉 단계에 맞는 표현으로 정책에 전달하는 과정까지 살펴볼 필요가 있습니다.
결과를 해석할 때
이 실험은 해당 논문의 로봇, 데이터와 다섯 작업에 대한 결과입니다. 기준선에 힘을 넣는 방식, 사전학습과 미세조정 조건이 달라지면 차이도 달라질 수 있습니다. 모든 VLA에 같은 개선률을 적용하거나 여러 논문의 최대 수치를 합치는 해석은 피해야 합니다.
참고 자료
- ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation ↗
2025 · v3 · §5.2, Figure 5. 논문별 실험 조건을 유지해 비교합니다.