跳到正文

#评测/基准

今日 1 条
今天9月29日周二
  1. Simon Willison78

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于前者。

    推荐理由:作者用同一套鹈鹕测试对比 Sonnet 5.5 与 Opus 5.5,并指出免费层模型能力差异,可据此判断性价比。

9月25日周五
9月23日周三
8月13日周四
  1. Microsoft Research38

    MindTopo:微软推出评估多模态模型拓扑空间推理能力的新基准

    微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨序列仍不可靠。