zimplex2026
Genesis HR Bench Pour-Water VLA Evaluation Traces
Evaluation traces for vision-language-action models on the pour-water task in Genesis HR Bench, including corrected GCP pilot results with avatar collision tracking and original AWS H200 run data.
Downloads0
Episodes60
Why This Matters for Physical AI
This dataset evaluates multiple vision-language-action models on a complex manipulation task (pouring), providing critical benchmark data on collision handling and task success rates for embodied AI systems.
Technical Profile
- Modalities
- rgbstate
- Robot Embodiments
- humanoid
- Action Space
- vision-language-action
- Environment
- simulation
- Task Types
- pouringmanipulation
- Episodes
- 60
- Data Format
- json
- Annotation Types
- action_labelscollision_detectionsuccess_labels
Access
Need custom rgb data?
Claru builds purpose-built datasets for simulation applications with dense human annotations and quality assurance.
Request a Sample Pack