AkashKarnatak2026MIT

LingBot-VA BEHAVIOR-1K generated training artifacts

Precomputed Wan2.2 VAE camera latents, UMT5 text embeddings, and generated training metadata for LingBot-VA BEHAVIOR-1K experiments. Contains processed artifacts for 5,000 training episodes and 1,000 validation episodes across 100 tasks, plus 200 radio-turning episodes.

Downloads0
Episodes6,200

Why This Matters for Physical AI

This dataset provides large-scale precomputed latent representations and language embeddings for robotic manipulation tasks, enabling efficient training of vision-language models for embodied AI without requiring real-time VAE encoding during training.

Technical Profile

Modalities
rgblanguage
Task Types
manipulation
Episodes
6,200
Data Format
tar
Annotation Types
language_instructionsaction_labels
License
MIT
Part of the BEHAVIOR-1K family

Access

Need custom rgb data?

Claru builds purpose-built datasets for any environment applications with dense human annotations and quality assurance.

Request a Sample Pack

Related Datasets