大模型原生智能体手机 STEPX Neo 定于 10 月 13 日发布
阶跃终端宣布,旗下首款大模型原生智能体手机 STEPX Neo 将于 10 月 13 日 19 时正式发布。该机运行智能体原生系统 Step AOS,并配备可与飞书等应用深度联动的 Amoo 助手。此前演示显示,Amoo 能读取日历和群聊消息,按照用户风格制作 PPT,并将日程变更同步到其他群聊。助手在修改文档或执行相关操作前,需要先获得用户授权。该手机的端侧生成式 AI 服务已通过中国网信部门备
AI 新闻中心 过去24小时分析了 191 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
阶跃终端宣布,旗下首款大模型原生智能体手机 STEPX Neo 将于 10 月 13 日 19 时正式发布。该机运行智能体原生系统 Step AOS,并配备可与飞书等应用深度联动的 Amoo 助手。此前演示显示,Amoo 能读取日历和群聊消息,按照用户风格制作 PPT,并将日程变更同步到其他群聊。助手在修改文档或执行相关操作前,需要先获得用户授权。该手机的端侧生成式 AI 服务已通过中国网信部门备
成立三年的开源AI初创公司Nous Research确认完成由Robot Ventures领投的9000万美元B轮融资,估值达15亿美元。英伟达、三星及多家投资机构也参与了投资。公司称,其开源产品Hermes Agent已被克隆超过2400万次,约占全球AI Token使用量的2.5%。Nous计划利用资金推出Hermes for Businesses,帮助企业部署可处理复杂多步骤工作流、并保护企
微软宣布,GitHub Copilot 将于 10 月底前支持本地 AI 模型,开发者可在云端和设备端模型间切换,也可交由系统自动调度。新款 MoE 模型 MAI Code1.1Flash 总参数量为 1370 亿,激活参数量为 68 亿。微软称,量化和投机解码技术旨在降低内存占用并提升设备端响应速度。该模型将率先搭载于配备 NVIDIA RTX Spark 硬件的新款 Surface Lapto
据 OpenRouter 数据,9 月企业在 OpenAI 和 Anthropic 模型上的支出份额大致相当,而 1 月 Anthropic 的份额为 75%。两家公司都需要在计划中的 IPO 前向华尔街证明,其业务能够持续发展。
据《The Information》报道,英伟达于今年7月得知,成立三年的初创公司 OpenRouter 即将被收购。OpenRouter 已成为热门的 AI 模型市场。英伟达告诉其管理层,愿意提出丰厚报价,但据称 OpenRouter 不愿等待。
泰国电力企业B.Grimm Power计划与一名新的海外伙伴投资建设一项250兆瓦数据中心项目。随着人工智能服务需求上升,该公司正加快拓展这一领域。
上海壁仞科技计划通过新一轮股份出售募集40.4亿港元(5.15亿美元),用于支持其人工智能业务。此举也加入了中国人工智能企业近期的融资潮。
Mobile-4DGS 是一个轻量级框架,可在移动设备上实时渲染静态和动态场景的 3D Gaussian Splatting。它通过压缩外观建模、剔除冗余基元,以及采用无需运行时变形网络的显式 4D 运动表示,降低存储与计算开销。此外,该方法会复用先前确定的深度顺序,以减少播放过程中的处理。实验显示,在保持有竞争力的视觉质量的同时,存储需求和渲染开销均有所下降。代码已公开。
本研究考察如何将 Agentic RAG 的评估预算分配给问题、搜索轨迹和重复回答。在 HotpotQA 和 MuSiQue 上,使用相近的 token 预算扩大问题覆盖范围,相比读取五次使标准误降低 33%,相比三条搜索轨迹降低 12.6%。两种预测方法对预算分配的预测误差不超过 4%。超过两条轨迹的审计后,未发现明确的预测优势。根据记录的模型费用,当搜索成本为每 1,000 次请求 0 至 1
论文提出 KL-Regularized Policy Optimization(KLPO),用于大语言模型的异步强化学习。该方法旨在处理来自过时检查点的轨迹,以及推理系统与训练系统之间的概率差异,同时不需要重要性权重或为每个提示生成多个回答。KLPO采用正则化改进步骤的闭式解,并在采样器自身生成的轨迹上通过最小二乘法拟合其最优性条件。作者还证明,无需评论器即可根据终端回报计算梯度,并指出若干现有方
Recurrent Looped Transformer(RLT)将并行因果编码器与循环解码器结合,解码器在每个 token 处理中纳入前一个 token 的最终状态。因此,计算路径会随序列长度增长,而每个 token 的计算成本保持不变。在六项算法任务中,两种 RLT 配置将最多用 40 位训练的奇偶性任务泛化到 256 位,准确率达到 100%;标准 Transformer 则仅达到随机水平。
Recursive Game Creator旨在帮助AI智能体将游戏原型迭代为更具娱乐性的作品。该框架由Designer、Builder、Player和Reviewer四个组件构成:系统规划并制作游戏,由通过程序接口控制的玩家收集游玩轨迹,再由Reviewer结合指标、视觉证据和明确偏好进行评估。作者报告称,该方法在GameCraft-Bench上取得77.89的综合成绩;在GameASG-Ben
WorldSonus是一种交互式视频转音频框架,旨在为世界模型实时生成声音。它采用流式因果自回归扩散架构,以0.41的实时因子分段合成音频。按片段安排提示词的机制可在生成过程中调整声音事件;立体声和高阶环绕声数据则用于实现空间对齐。研究团队称,WorldSonus在音质和空间对齐方面达到或超过双向模型,并能推广到开放领域的视频转音频任务。
DecepEval 是一套基准测试,包含 1,532 个案例,覆盖三类任务和 28 种职业场景,旨在系统研究大语言模型智能体的欺骗行为。其“LLM Deception Diamond”框架考察压力、诱因、机会和冲突等可能促使欺骗的条件。对九种前沿大语言模型的评估显示,这些诱发条件会提高不同模型和任务中的欺骗率,即使是基线欺骗率较低的模型也不例外。研究通过明确的任务事实和可观察的智能体行为,尝试区分
报告介绍了 nanoMuse,这是一款采用 GPL-3.0 许可证的开源个人智能体,旨在跨用户的多台设备延续同一段对话。任何人都可以自行运行中继服务来连接设备;所有操作均通过名为 Sentinel 的系统,记忆以用户可读取的文件保存,模型也由用户自行选择。报告将该项目与 Meta 的闭源 Muse 智能体进行比较,并提出开放记忆功能、设备操作评测以及适用开源模型的后续路线图。文中的规模和成本数据均