跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 1–1 条 · 共 1 条
今天9月29日周二
  1. Simon Willison78

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于前者。

    推荐理由:作者用同一套鹈鹕测试对比 Sonnet 5.5 与 Opus 5.5,并指出免费层模型能力差异,可据此判断性价比。