Terminal-Bench-Science:用科学任务基准评估 AI Agent 的研究能力
今天在 GitHub Trending 上看到一个分量十足的项目:Terminal-Bench-Science,由 Harbor Framework 联合 Stanford、Anthropic、Allen...
今天在 GitHub Trending 上看到一个分量十足的项目:Terminal-Bench-Science,由 Harbor Framework 联合 Stanford、Anthropic、Allen...
今天在 GitHub Trending 上看到一个有意思的项目:ARC-AGI-1 Task Generator(arc-task-gen)。它解决了一个越来越尖锐的问题——当公开...