figai2026cc-by-4.0
RIDGE: Revealing Item-level Differences of Generalist agents across digital and physical Environments
Item-level results and agent traces from evaluating frontier models (Astra, Opus, GPT, etc.) on web browsing and physical robotics tasks including driving, tabletop manipulation, and assembly. The dataset contains 1,239 web task rollouts and 5,210 physical domain evaluations with detailed model outputs and reasoning traces.
Downloads55
Likes2
Technical Profile
- Modalities
- rgblanguage
- Environment
- simulationlab
- Task Types
- manipulationnavigationweb_browsingdrivingassemblyaction_anticipation
- Data Format
- parquet
- License
- cc-by-4.0
Access
Need custom rgb data?
Claru builds purpose-built datasets for simulation applications with dense human annotations and quality assurance.
Request a Sample Pack