Myungkyu

RoboDojo-taco-visual-gemini

Visual-grounding variant of RoboDojo-taco-gemini containing 800 long-horizon episodes across 8 tasks with dense high-level labels and target positions marked as visual keyframes instead of text coordinates.

Downloads92
Episodes800

Why This Matters for Physical AI

This dataset enables training of low-level visuomotor policies that can interpret both visual spatial cues and language instructions, advancing research in hierarchical planning and vision-guided manipulation for robotic systems.

Technical Profile

Modalities
rgbproprioception
Robot Embodiments
dual_arm_manipulatorARX X5
Action Space
joint_positions
Environment
simulation
Task Types
manipulationobject_classificationpick_and_placestackinggame_playing
Episodes
800
Data Format
LeRobot
Annotation Types
language_instructionsaction_labelsbounding_boxessegmentation
Part of the RoboDojo family

Access

Need custom rgb data?

Claru builds purpose-built datasets for simulation applications with dense human annotations and quality assurance.

Request a Sample Pack

Related Datasets