الباحثون

Gabriele Scalia

المنشورات 1

نسخة أولية وصول مفتوح

AutoSciBench: Autonomous Benchmark Generation for Evaluating Scientific Agents

Dongki Kim, Namkyeong Lee, Surag Nair وآخرون · 2026

As agents rapidly evolve, existing benchmarks can become saturated, limiting their ability to distinguish capabilities and reveal remaining failure modes. Particularly in scientific domains, constructing and updating benchmarks requires substantial time, labor, and domain expertise, making it difficult to keep evaluati …

المؤلفون المشاركون