Myungkyu
RoboDojo-taco-visual-gemini
Visual-grounding variant of RoboDojo-taco-gemini containing 800 long-horizon episodes across 8 tasks with dense high-level labels and target positions marked as visual keyframes instead of text coordinates.
Downloads92
Episodes800
Why This Matters for Physical AI
This dataset enables training of low-level visuomotor policies that can interpret both visual spatial cues and language instructions, advancing research in hierarchical planning and vision-guided manipulation for robotic systems.
Technical Profile
- Modalities
- rgbproprioception
- Robot Embodiments
- dual_arm_manipulatorARX X5
- Action Space
- joint_positions
- Environment
- simulation
- Task Types
- manipulationobject_classificationpick_and_placestackinggame_playing
- Episodes
- 800
- Data Format
- LeRobot
- Annotation Types
- language_instructionsaction_labelsbounding_boxessegmentation
Access
Need custom rgb data?
Claru builds purpose-built datasets for simulation applications with dense human annotations and quality assurance.
Request a Sample Pack