OpenAI 首席科学家回应 AI 推理不透明争议
OpenAI 首席科学家雅各布·帕乔基在 X 上回应了外界对 AI 模型 Astra 可能因递归处理而难以监控的担忧。他表示,包括 Astra 在内的前沿模型,其计算图深度不到 GPT-4 的两倍,模型架构并未出现突然的复杂度跃升。OpenAI 计划为 Astra 部署额外的思维链监控。帕乔基承认,这类监控目前仍较为脆弱,但加强监控是公司的核心研究目标之一。争议源于“深度循环”技术:模型会反复调用
AI 新闻中心 过去30天分析了 4649 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI 首席科学家雅各布·帕乔基在 X 上回应了外界对 AI 模型 Astra 可能因递归处理而难以监控的担忧。他表示,包括 Astra 在内的前沿模型,其计算图深度不到 GPT-4 的两倍,模型架构并未出现突然的复杂度跃升。OpenAI 计划为 Astra 部署额外的思维链监控。帕乔基承认,这类监控目前仍较为脆弱,但加强监控是公司的核心研究目标之一。争议源于“深度循环”技术:模型会反复调用
Govee推出了三款新的照明产品。售价400美元、支持Matter的Sky吸顶灯搭载AI Lighting Bot 2.0,可根据用户的心情或指令调整灯光颜色。它支持478nm天蓝色光谱、1,000K至10,000K的白光色温,以及最高7,000流明亮度。售价170美元的COB Strip Light 2 Pro可通过AI文本提示生成定制灯光场景,适用于游戏、聚会和观影等场景。Permanent
多家国际律师事务所正在开发定制化人工智能工具,以实现差异化竞争并保护自身知识产权。对于日常工作,它们仍使用市场上现成的人工智能服务。经过数年的学习、试验和规划后,这些事务所开始推进内部平台建设。
博通预计,未来两年人工智能芯片销售将大幅增长,市场再次燃起其挑战英伟达在这一高利润市场主导地位的希望。公司还预计,2028财年每股收益将超过30美元,高于华尔街预期。不过,这些内容属于对未来增长的预测,尚不能证明英伟达的市场领先地位已经受到实质性削弱。
VibeVoice-ASR-Streaming 是一款用于实时流式自动语音识别和说话人归属的端到端模型。不同于将语音识别与说话人分离作为两个独立任务的传统系统,该模型结合固定大小的音频片段、少量前瞻音频和先前文本,在语音到达时直接输出“谁说了什么”。根据公布的评测结果,7B 模型在五个评测集上取得最低的平均 WER/CER,并在 13 项说话人归属设置中的 12 项达到最佳或并列最佳表现。研究团队
Uber 正与司机工会合作,试图放缓机器人出租车在美国各地的推广。随着自动驾驶汽车的发展,这家网约车平台的核心业务面临潜在的技术颠覆。考虑到 Uber 多年来与司机关系紧张,如今支持司机的做法可能显得颇为讽刺。
CRISP是一种加速长上下文大语言模型推理中注意力预填充阶段的方法。它利用代理注意力图的结构,直接识别适合的稀疏注意力模式,从而替代开销较高的路由计算。该方法还引入了考虑注意力汇聚标记的阈值,以减少在长上下文中选择相关位置时不断累积的背景噪声。根据作者的实验,在两个模型系列以及InfiniteBench、RULER和LongBench评测中,CRISP在512,000个词元下实现了最高5.30倍的
特斯拉已就一宗源于2023年加州致命事故的诉讼达成保密和解。事故中,一辆开启Autopilot的Model S在康特拉科斯塔县的680号州际公路上,撞上一辆横停在车道上的消防车。驾驶员死亡,坐在副驾驶位的兄弟重伤。原告指控特斯拉的驾驶辅助技术存在缺陷,并称“Autopilot”这一名称及埃隆·马斯克的公开言论误导消费者高估系统能力。联邦法官允许涉及欺诈性虚假陈述的指控继续推进,但驳回了隐瞒信息的相
小米近日展示了一款内嵌玄戒 O3 芯片的纪念铝板。玄戒 O3 于 8 月 24 日发布,是小米面向高端产品打造的 AI SoC,预计首发搭载于小米 18 Fold 和小米平板 9 Pro Max。小米称,该芯片采用最高 4.35GHz 的十核 CPU、16 核 GPU,支持 LPDDR6,并配备最高 200 TOPS 的全新 NPU,同时集成自研 ISP 和 RISC-V 安全核心。文中涉及的性能
洛杉矶联合学区已在提供给约38万名学生的学区笔记本电脑和平板电脑上屏蔽生成式人工智能工具。学区官员正在审查人工智能在课堂教学中的作用。
Equinix与英伟达达成协议,客户将能够在Together AI平台上运行自己的人工智能模型。随着市场对AI工作负载和数据中心容量的需求不断增长,这项合作将加强Equinix作为AI基础设施供应商的地位。Equinix股价年初至今上涨33%,公司市值升至约1000亿美元。
S3Gym是一项交互式基准测试,用于评估大语言模型能否测试自身行为、判断由此产生的经验,并改进未来的决策。该方法将开放式探索与严格的保留集评估分开,并在七个配备可执行环境验证器的文字游戏中测试智能体。研究比较了三种利用交互经验的路径:直接使用历史记录进行上下文学习、基于得分的摘要记忆,以及参数训练。结果表明,自我改进既不会自动发生,也不具有一致性。当经验能够被压缩为可复用的策略规则时,摘要更有帮助
ASPIRE是一项用于评估人工智能系统能否根据模糊目标自我改进的基准测试,例如“成为更好的研究者”。系统不会获得明确的任务和评估指标,只会收到一项自然语言能力目标。随后,智能体必须自行选择数据和更新方法,构建训练与验证信号,并决定评估时机。ASPIRE同时支持模型权重更新和智能体框架演化,并通过覆盖六个目标的520道专家编写隐藏题目进行评估。实验显示,当前智能体通常能够完成训练和框架编辑循环,但权
谷歌面向即将推出的 Googlebook 平台开发的 Look up 应用曾短暂上架 Google Play,随后被官方下架。该应用定位为桌面端上下文工具,用户选中文字后,无需离开当前页面,即可通过浮动窗口查看相关信息。已展示的信息来源包括 Google 搜索、Google 地图和 Google 航班,支持词义解释、地点信息和航班动态查询。用户还可以在类似聊天机器人的输入框中继续提问,将单次查询扩
Anthropic 扩展了 macOS 版 Claude Cowork 和 Claude Code 的电脑控制功能。用户处理其他工作时,Claude 现在可以在后台通过屏幕交互执行点击、输入文字和导航操作。该功能要求使用 macOS 15 或更高版本,Mac 保持唤醒状态,并保持 Claude Desktop 应用打开。用户还可以在设置中启用“完全控制”模式。目前该功能仅面向个人 Pro 和 Ma