Terminal-Bench-Science:用科学任务基准评估 AI Agent 的研究能力
今天在 GitHub Trending 上看到一个分量十足的项目:Terminal-Bench-Science,由 Harbor Framework 联合 Stanford、Anthropic、Allen...
今天在 GitHub Trending 上看到一个分量十足的项目:Terminal-Bench-Science,由 Harbor Framework 联合 Stanford、Anthropic、Allen...