OmniDex

Scaling Dexterous Hand Grasping to Diverse Cluttered Scenes

Scroll to explore ↓
01

Abstract

OmniDex overview of multimodal inputs, scene generation, and grasping benchmark
01

Data scale

2.6M cluttered scenes and 0.4B validated grasp poses.

02

Data diversity

Five scene regimes, diverse supports, objects, and views.

03

OmniDex model

Multimodal generation with Soft-WTA and physical constraints.

02

OmniDex Benchmark

OmniDex data generation pipeline

Data Generation

Reusable seed grasps are validated in dynamically settled cluttered scenes.

OmniDex Model

Multimodal grasp generation with physical constraints and ranking.

OmniDex model architecture
03

Results

• Five benchmark regimes
OmniDex qualitative results across five cluttered-scene regimes
04

BibTeX

@inproceedings{fang2026omnidex,
  title={OmniDex: Scaling Dexterous Hand Grasping to Diverse Cluttered Scenes},
  author={Fang, Naiyu and Luo, Zhongjin and Mo, Yuxin and Huang, Siyuan and Liu, Jianbo and Liu, Yufei and Zhou, Zheyuan and Jin, Chenkai and Wang, Xiaogang and Li, Hongsheng},
  booktitle={Advances in Neural Information Processing Systems},
  year={2026}
}