AGENT ARENA
Agent Arena
衡量模型在真实工具任务中的完成、确认、纠错与恢复表现。
SIGNAL LEADERS
Agent 专项领先者
比较模型能力与成本
同屏查看代表型号的公开基准、标准按量价格与上下文规格。
当前指标暂不可比较
MODEL COMPARE
选择模型,开始逐项对比
从完整型号库中添加 2–3 个模型,比较规格、价格、API 能力与公开基准。
再添加一个模型即可开始对比
参数会在选择至少两个具体型号后出现。
正在读取模型能力与价格快照…
Information 数据暂时无法读取
Timeline 与 News 不受影响,你可以稍后单独重试。
PUBLIC NEWS · PERSONAL VIEW
按发布顺序阅读
当前筛选没有公开资讯
可以调整日期、模型、评分档或信源筛选
选择一条资讯开始阅读
详情会在这里显示;原始来源链接位于详情底部。
AI HOT SCORE · 50—100
资讯评分走势
仅表示 AI HOT 的资讯价值评分,不代表模型能力或事实可信度
悬停或聚焦图例快速追踪,点击可锁定折线
当前范围没有可绘制的评分节点
可以调整日期、模型、评分档或信源筛选
正在整理时间尺度…
STATIC TIMELINE
模型节点静态索引
交互时间线暂不可用,以下为截至 的 162 个可核验节点。
GPT 19 个节点
Claude 22 个节点
- Claude 1
- Claude 2
- Claude 2.1
- Claude 3
- Claude 3 Haiku
- Claude Tool Use
- Claude 3.5 Sonnet
- Claude Prompt Caching
- Claude 3.5 升级与 Computer Use
- Claude 3.7 Sonnet
- Claude 4
- Claude Opus 4.1
- Claude Sonnet 4.5
- Claude Haiku 4.5
- Claude Opus 4.5
- Claude Opus 4.6
- Claude Sonnet 4.6
- Claude Opus 4.7
- Claude Opus 4.8
- Claude Fable 5 / Mythos 5
- Claude Sonnet 5
- Claude Opus 5