AkashKarnatak2026MIT
LingBot-VA BEHAVIOR-1K generated training artifacts
Precomputed Wan2.2 VAE camera latents, UMT5 text embeddings, and generated training metadata for LingBot-VA BEHAVIOR-1K experiments. Contains processed artifacts for 5,000 training episodes and 1,000 validation episodes across 100 tasks, plus 200 radio-turning episodes.
Downloads0
Episodes6,200
Why This Matters for Physical AI
This dataset provides large-scale precomputed latent representations and language embeddings for robotic manipulation tasks, enabling efficient training of vision-language models for embodied AI without requiring real-time VAE encoding during training.
Technical Profile
- Modalities
- rgblanguage
- Task Types
- manipulation
- Episodes
- 6,200
- Data Format
- tar
- Annotation Types
- language_instructionsaction_labels
- License
- MIT
Access
Need custom rgb data?
Claru builds purpose-built datasets for any environment applications with dense human annotations and quality assurance.
Request a Sample Pack