AI 新闻中心

AI 新闻中心 过去一年分析了 4045 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

OasisKV通过前瞻式稀疏预取将解码KV缓存扩展到HBM之外

OasisKV是一套旨在降低大语言模型推理内存需求的研究系统。在解码过程中,它只将对注意力计算最重要的KV缓存条目保留在高带宽内存(HBM)中,并从主机内存或远程内存等容量更大的存储层预取其他条目。系统利用推测解码生成的前瞻令牌,预测下一步所需的KV块。基于vLLM实现的原型在2048个令牌的KV预算下,相比完整注意力的准确率差距控制在0.7个百分点以内。与密集型vLLM相比,OasisKV在推理

iOS 27 Beta 5 暗示国行 iPhone 或将支持 Apple Intelligence

消息人士 @aaronp613 称,在 iOS 27 Beta 5 的更新代码中发现了苹果为中国市场部署 Apple Intelligence 的准备工作。相关字符串显示,用户请求将在设备端处理,不会发送给苹果或当地安全机制提供商。为遵守相关法律法规,苹果将以匿名化方式收集必要信息,并以汇总形式共享。该安全机制将自动下载和更新。上述内容来自测试版代码,目前尚未确认正式上线时间。

扎克伯格6500字人工智能宣言反成批评靶心

Meta首席执行官马克·扎克伯格在一篇约6500字的文章中提出“个人超级智能”愿景,设想让每个人都拥有个性化AI导师和高能力AI律师。但TechCrunch批评称,这份宣言几乎回避了人工智能已经造成的现实危害。ChatGPT、Claude和Gemini等工具已经能够帮助学生撰写作业和论文,而教师缺乏可靠手段识别AI生成内容。让所有人都能使用AI律师,也可能催生大量低质量诉讼,进一步增加司法系统负担

因子化假设搜索提升从间接证据中进行分类检索的效果

研究人员提出因子化假设搜索(FHS),用于改进大型分类体系中的检索,尤其适用于输入内容仅间接表达目标概念的情况。例如,表格单元格的含义可能取决于其行、列、数据类型和上下文。FHS围绕多个命名语义维度维护部分解释,并结合结构化查询生成、多假设检索以及维度级候选验证。在金融分类体系标注和CodiEsp临床编码任务中,FHS在不依赖预知答案的方法中取得了最佳的Recall@1、平均倒数排名(MRR)和最

Ouroboros:具备经审查核心演化能力的自我发展型编程智能体

Ouroboros是一套智能体框架,通过经审查的提交持续改进工具、提示词、上下文组装方式和核心实现,并将这些变更用于后续运行。其演化既可以递归进行,也可以由日常工作和社会互动中发现的缺陷与低效问题推动。开发者表示,使用Opus 5的一次运行在Terminal-Bench 2.1、OSWorld-Verified和CL-Bench上取得了目前已报告的最高成绩。公开记录中的部署“Hope”已在独立分支

RynnValue:利用时间距离扩展机器人价值基础模型

RynnValue 是一个面向机器人操作的开源价值基础模型。它不依赖偏好或进度标注,而是使用时间距离,即从观测结果到语言指定目标的有向代价。这使模型能够利用超过 7,000 小时数据和约 300 万个指令条件视频片段进行训练。在 RBM-EVAL-OOD 基准测试中,RynnValue 的 Kendall tau_a 达到 0.675,超过完全使用偏好监督的方法(0.655)。将其转换为密集奖励后

消息称 SpaceX 收购 Cursor 后将逐步淘汰其品牌

据报道,SpaceX 今年 6 月同意以 600 亿美元估值收购 AI 编程初创公司 Cursor。交易仍需获得监管部门批准,预计最晚于 8 月底完成。知情人士称,Cursor 在全员会议上告知员工,未来几个月可能逐步淘汰 Cursor 品牌。正在开发中的通用 AI 智能体内部代号为“Sand”,可能改名为“Grok Bot”,或采用其他与 SpaceX 相关的新品牌。现有 Cursor 编程助手

消息称 Anthropic 最快将于9月上市,并淡化AI模型竞争等挑战

据《华尔街日报》报道,Anthropic正与潜在投资者接触,计划最早于9月或10月初进行首次公开募股。公司重点强调快速增长势头和编程工具Claude Code的成功,但投资者正关注中国低价AI系统的竞争、与特朗普政府的紧张关系,以及美国各地反对建设数据中心的声音。据知情人士透露,Anthropic高管淡化了中国AI企业的竞争影响,称多数用户仍希望使用能力最强的模型。公司还计划拓展AI在医疗和生物学

千问推出AI硬件开放平台,支持开发者定制AI眼镜功能

阿里巴巴已上线千问AI硬件开放平台,覆盖App、PC和AI眼镜。平台为开发者提供Skill全流程开发框架,可调用拍照、语音交互等能力;企业则可使用涵盖眼镜端、App和云端的技术底座。已公布的应用包括为视障人士提供障碍物提示、基于视线触发的文旅讲解、烹饪指导,以及工业和零售场景的设备与货架巡检。平台后续计划开放空间3D显示和运动健康感知等功能。

Evo-Bench:语言模型能否改进智能体框架?

Evo-Bench是一项用于评估语言模型能否自主优化AI智能体运行框架的基准测试。它覆盖搜索、办公和通用智能体任务,并试图将框架改进与基础模型能力区分开来。对9个前沿模型和开放权重模型的评估显示,最高绝对提升达到16.6分。自主进化在通用任务中超过人工构建的框架,在搜索任务上表现突出,但在需要高度特定处理流程的办公任务中表现较弱。研究还发现了早期饱和等时间异常,并表明生成的框架可以作为具有迁移性的

意图胜过表面:超越响应模仿的可控用户模拟

用户模拟器为训练和评估交互式助手提供了可扩展的环境。新方法UserIDA将下一轮用户发言应实现的局部交互意图,与表达该意图的语言形式分离开来。该方法采用六类意图接口、监督式微调,以及基于群组强化学习的意图校准策略优化。在LMSYS-USP上,UserIDA的意图准确率达到86.6%,比最强的专用基线高出24.3个百分点,同时提升了语义和风格相似度。在上下文内干预测试中,它在91.7%的对话状态中实

SWE-Bench ProMax 评估 AI 代理的大规模多语言代码重构能力

SWE-Bench ProMax 是一个由专家策划的基准测试,包含从真实提交中选取的 170 个代码重构任务,覆盖 Python、Java、TypeScript、Go、C、C++ 和 Rust 七种语言。该项目针对现有基准中的测试缺陷,以及模型可能从训练数据中逐字复现标准补丁等问题进行了改进。每个任务平均修改 11.4 个文件和 261.6 行代码,规模明显超过现有评测。在两种代理框架的实验中,最

Macaron-V1:探索结合自我改进与 Mixture-of-LoRA 的开放式持续学习

Macaron-V1 是一个开放式智能体模型系列,旨在从真实环境中的经验学习,并在部署后持续适应。其架构冻结基础模型,组合用于聊天、智能体任务、编程和 GenUI 的专用 LoRA 适配器,并在每轮用户交互中选择一个适配器。旗舰版本 Macaron-V1-Venti 使用 7440 亿参数的 GLM-5.2 基础模型;基于 500 亿参数 Qwen3.6 的 Macaron-V1-Tall 则面向

Anthropic开始为Claude所有输出添加机器可读标记

Anthropic正在为Claude部署双层标记机制:在文本中嵌入人眼不可见的水印,并为生成的SVG、PNG、JPG等文件附加符合C2PA标准的数字签名元数据。该机制自8月2日起应用于新发布的Claude模型,并在全球所有Claude产品中生效,不局限于欧盟。通过AWS、Google Cloud和Microsoft Foundry调用Claude生成的文本同样会带有水印,但文件元数据是否存在取决于

Anthropic 将永久维持 Claude Sonnet 5 首发优惠价

Anthropic 宣布,6 月底推出的 Claude Sonnet 5 将永久维持首发促销价格,原定于 9 月 1 日恢复的标准价格已取消。API 价格将继续维持输入每百万 Token 2 美元、输出每百万 Token 10 美元,而此前计划的价格为 3 美元和 15 美元。Claude Sonnet 5 拥有 100 万 Token 的上下文窗口。Anthropic 表示,该模型在推理、工具使