从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化翻译到 Apple Silicon,以及翻译层对性能差距的具体贡献。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化翻译到 Apple Silicon,以及翻译层对性能差距的具体贡献。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
伯克利 EPIC Data Lab 提出近零推理成本时代数据系统面临三大挑战:为智能体设计的数据系统、运行智能体集群的数据系统、由智能体合成数据系统。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。