Leaderboard

Model performance across VEPBench tasks. Each row is a committed, independently inspectable evaluation result against the latest task version.

committed · ranked by exact-match accuracy · API failures remain unscored