Anthropic 发布的自动化行为评测框架,从行为定义生成情境、运行对话并评分,用于量化前沿模型的特定行为倾向。
Tag
agent-evaluation
包含该标签的简调共 9 篇。
OpenAI 发布的计算生物学研究级基准,用合成但现实的脏数据任务测试 AI Agent 的分析路径选择、修正与决策判断。
SHADE-Arena 用带有正常主任务和隐藏有害副目标的长程环境,联合评估 Agent 的破坏能力与监控模型的识别能力。
AssetOpsBench 用工业资产运维场景、专职智能体和多智能体编排蓝图,帮助团队构建并评估面向 Industry 4.0 的智能体系统。
Sierra Research 提出的双控制对话智能体评测基准,用真实领域任务检验用户和智能体都能采取行动时的协作表现。
MLE-bench 是 OpenAI 开源的机器学习工程智能体基准,以 75 个 Kaggle 竞赛任务衡量数据准备、模型训练、实验和提交能力。
Terminal-Bench 用隔离终端环境和可验证任务评估智能体完成真实工作的能力,适合比较代理系统,但结果高度依赖任务版本与运行环境。
AI 评测与安全平台出身的公司,当前官网叙事转向 simulation research and infrastructure,同时仍保留评测、guardrails 和 agent 评估相关公开材料。
LangChain 推出的 AI 应用与 agent 工程平台,覆盖运行链路追踪、离线和在线评测、提示词管理,以及云端、混合和自托管部署。