损失函数看不见基底,但 Adam 看得见
一项理论与实证研究解释了:在因式分解模型 W = UVᵀ 中,梯度下降会隐式偏好低秩解,而 Adam 即使从相同的小幅初始化出发,也不会表现出这一特性。差异源于损失函数的规范对称性。若要保留梯度流产生低秩解的机制,优化器必须对 U 和 V 的等价变换保持等变性。梯度下降、动量法、共享标量 Adam、Muon 和 Shampoo 满足这一条件;Adam、RMSProp 及其他按坐标更新的方法则不满足
AI 新闻中心 过去一年分析了 7678 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项理论与实证研究解释了:在因式分解模型 W = UVᵀ 中,梯度下降会隐式偏好低秩解,而 Adam 即使从相同的小幅初始化出发,也不会表现出这一特性。差异源于损失函数的规范对称性。若要保留梯度流产生低秩解的机制,优化器必须对 U 和 V 的等价变换保持等变性。梯度下降、动量法、共享标量 Adam、Muon 和 Shampoo 满足这一条件;Adam、RMSProp 及其他按坐标更新的方法则不满足
零一万物创始人兼CEO、创新工场董事长李开复在北京表示,越来越多美国企业开始采用中国开源产品,原因包括模型能力和较低成本。他称,美国最强的模型目前只比月之暗面的Kimi K3略胜一筹,而Kimi K3的价格可能低约60%。李开复还指出,外界正在公开讨论开源模型生态是否会削弱,甚至动摇美国以闭源模型为主的产业体系。报道中的性能和价格比较均来自李开复的说法,尚未经过独立验证。
研究人员开发了一种从 Claude、GPT 和 Gemini 中提取所谓“推理痕迹”的方法。他们表示,研究结果表明,一些中国人工智能系统可能使用美国领先模型进行过训练。
由xAI联合创始人伊戈尔·巴布什金创办的初创公司River AI,在General Catalyst领投的融资中筹得10亿美元。公司计划开发面向家庭和小型企业的计算机服务器,使人工智能能够在本地运行,并让用户可以修改或重新训练相关系统。
风险投资公司红杉资本放弃此前的谨慎态度,在人工智能领域竞争加剧之际增加对AI初创公司的投资。
Anthropic表示,尚未公开的研究版Claude将黎曼ζ函数非平凡零点位于临界线上的比例之已知下界,从41.6%提高至67.2%。这项持续数日的实验在Claude Code中自主完成,共生成3100万个输出Token。经历650次失败尝试后,系统调动60个子智能体,执行2400条Shell命令并编写数百个Python脚本。内部数学家和外部数论专家审查了结果,部分证明还通过Lean进行了形式化验
人工智能正在改变首席技术官的职责。未来,CTO不仅要管理工程团队,还需要设计和监督用于规范自主软件开发的系统。
文章介绍中小企业如何将人工智能实验转化为可衡量的增长,重点是把人工智能整合到更高效的工作流程中,并从零散试验转向系统化应用。
菲尔兹奖得主、牛津大学数学教授詹姆斯·梅纳德正在思考数学领域的未来。他在接受《The Verge》采访时表示,数学这一传统上发展缓慢的学科,正因人工智能的快速进步而加速适应。文章节选显示,人工智能对数学研究的影响正在扩大,但目前没有提供具体技术突破的细节。
印度IT服务业雇用约600万人,贡献约7%的国内生产总值,年收入超过3000亿美元。据《金融时报》报道,随着AI自动化标准化、公式化任务,该行业正在减少就业岗位。报道分析了这一趋势对劳动者的影响,包括印度主要科技中心班加罗尔的员工。
OpenAI已将Yelp预订功能整合到ChatGPT中。美国和加拿大的用户可以在与聊天机器人交流时直接预订餐桌。
如果运营成熟度不足,部署人工智能可能会造成割裂的客户体验,而不是改善客户体验。
世界各地的实验室正在利用人类细胞培育微型大脑。文章推测,这些脑类器官未来可能在某些任务上超越神经网络。不过,简介没有提供它们目前已经具备这种能力的证据。
OpenAI 正在招聘一名电力交易负责人,负责管理其不断扩大的数据中心电力需求及大宗商品对冲。随着运行人工智能模型的基础设施耗电量上升,科技企业正寻求更可靠的电力供应。
BDH-CQ是一种将上下文学习与循环潜在处理相结合的推理模型。在推理过程中,输入会持续更新循环记忆,模型随后在高维潜在空间中通过迭代计算解决查询,而不会用语言表达中间推理过程。在公开的ARC-AGI-1评测集上,一个拥有1.5亿参数的配置以每项任务0.0007美元的计算成本取得了29.5%的pass@2成绩。该结果突破了此前公布的成本—准确率帕累托前沿,在基准测试的成本效率方面创下新的最佳水平。