AGI / AGENT / WORKFLOW EVALUATION

理解 AI,先理解
它如何行动。

衡见聚合并解读模型、Agent 与真实工作流的评测基准、方法、论文和争议。我们不只记录分数,也追问每个结果真正说明了什么。

不提供虚假的「AGI 总分」;关注能力、边界与可验证的证据。

EVALUATION SCOPE / 01—04
01模型能力基础
02Agent行动系统
03工作流真实交付
04物理 AI世界交互
证据
而非口号

THE EVALUATION MAP

AI 能力不是一张排行榜。

它是一组需要分别观察的问题:会不会、能不能、稳不稳,以及我们是否敢把它放进真实世界。

FIELD NOTE / WORKFLOW EVALUATION

从“能做”到
“敢让它做”

一个 AI 能写出正确代码,不等于它能安全地参与 CI/CD;一个 Agent 能完成一次任务,也不等于它能成为可靠的工作流节点。

当 AI 从回答问题走入研发、审查、发布、运维与协作,评测对象不再只是模型,而是由模型、工具、权限、人工复核、环境与流程共同构成的系统。

阅读工作流评测框架
01结果质量符合真实验收标准吗?
02稳定与恢复异常时能诊断、降级、求助吗?
03人类介入审批、返工和兜底成本有多少?
04安全权限是否越权,是否可回滚?

OBSERVATIONS

观察

不追逐每一次发布,优先解释结果背后的信号与噪声。

SELECTED BENCHMARKS

从一个基准开始

查看评测地图
AGENT2023

GAIA

通用 AI 助手的多步骤真实任务评测。

重点
推理 · 工具使用 · 多模态
提醒
脚手架会显著影响结果
查看解读 ↗
ENVIRONMENT2024

OSWorld

在真实桌面与网页环境中衡量电脑操作能力。

重点
跨应用操作 · 长程执行
提醒
环境稳定性决定复现难度
查看解读 ↗
SOFTWARE2024

SWE-bench

基于真实 GitHub 问题的软件工程任务。

重点
代码修改 · 测试验证
提醒
修复不等于完整工程交付
查看解读 ↗

METHODOLOGY

评测不是一串数字,
而是一套关于“完成”的假设。

A LONG VIEW

今天评估数字世界的行动,
明天理解物理世界的协作。

从模型能力、Agent 与工作流,到具身智能与物理 AI:衡见记录评测方法如何随 AI 进入真实世界而演进。评测任务、环境、轨迹与验证证据,也将成为值得长期构建的公共资产。