Terminal-Bench-Science:用科学任务基准评估 AI Agent 的研究能力

今天在 GitHub Trending 上看到一个分量十足的项目:Terminal-Bench-Science,由 Harbor Framework 联合 Stanford、Anthropic、Allen...

技术 · AI · 开源 · 周六, 八月 29, 2026 · 5 分钟 · 2427 字