AI 新闻中心

AI 新闻中心 过去7天分析了 930 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

UniProbe:面向大型视觉语言模型的可学习令牌级幻觉检测器

UniProbe是一种轻量级检测器,旨在以令牌为单位识别大型视觉语言模型生成的幻觉。它无需对整个模型进行高成本微调,而是通过一次前向传播分析模型的内部计算轨迹,包括图像块、查询令牌、生成令牌及其注意力关系。该方法结合图神经网络、Vision Transformer和GRU,整合关系、空间与序列信息。流式版本可在生成过程中检测并重新采样产生幻觉的令牌。作者称,在多种LVLM骨干模型上,UniProb

宇树科技发布“超人”人形机器人:原地跳高2米,最高速度12.66米/秒

宇树科技发布新款人形机器人“超人”。公司称,该机器人腿长0.85米,可原地跳高2米,最高速度达到12.66米/秒。宇树科技表示,这些数据超过了人类原地垂直跳跃和奔跑速度纪录,但相关结果目前主要来自公司公布的测试。该整机仅用3个多月完成开发,未来几个月仍将进行大幅改进。今年4月,宇树科技曾称其H1机器人达到10米/秒。公司还于8月12日宣布,旗下双足人形机器人累计产量约1.8万台,不包括其他类人形机

348万澳元报告被ChatGPT“润色”:澳大利亚社交媒体禁令依据曝出虚假引用

澳大利亚耗资348万澳元委托进行的年龄验证技术测试报告陷入争议。负责测试的英国机构ACCS最初否认使用人工智能,但《卫报》在报告链接中发现ChatGPT元数据后,该机构承认曾用AI改写部分段落。调查发现,仅报告中关于新兴技术的章节就有至少6处参考文献错误,包括DOI指向不存在或不相关的论文,以及作者、期刊和年份与已知研究不符。ACCS随后提交的纠错清单也存在问题。这份报告原本旨在为澳大利亚禁止16

韶音 OpenFit 2 AI 耳机开启预售:搭载千问模型,续航最长 48 小时

韶音已在中国开启 OpenFit 2 AI 开放式耳机预售,首发价为 1398 元。耳机基于千问 AI 模型,支持语音录音、转写、翻译和自动生成总结。用户可通过耳机、充电盒或应用发起录音,最长记录 8 小时。系统支持 30 种语言、19 种方言以及四种翻译模式。耳机还配备 IP55 防护、蓝牙 5.4、双设备同时连接和四麦克风通话降噪功能。单只耳机音乐续航最长 11 小时,搭配充电盒后总续航可达

时间序列基础模型出现预测崩溃

一项研究发现,时间序列基础模型在预测1,000只美国股票的小时收益率时会出现“预测崩溃”:预测结果近乎扁平,股票排名表现也很差。相比之下,在相同条件下预测交易量时,该现象大幅减弱。研究人员认为,原因包括目标变量的可预测性较低,以及按单个序列优化的目标函数无法识别序列之间的结构。最小化平方误差会导致扁平预测,而直接优化横截面相关性虽能改善排名,却可能使预测幅度放大一个数量级以上。研究提出CalibR

Second Thought:LLM智能体行动与观察期间的并行推理

采用ReAct范式的LLM智能体会在推理、行动和观察之间交替进行,但在等待环境响应时,推理会暂停。Second Thought利用这段空闲时间,在每次Thought阶段结束后立即并行启动四个辅助推理分支,并在下一次环境观察到达时合并结果。在三个智能体基准和三个推理模型上,该方法在全部九个模型与基准组合中都降低了平均交互轮数。在其中六个组合中,主线程的顺序解码量最多减少43%,第七个组合基本不变。P

潜在在线策略自蒸馏

该研究提出潜在在线策略自蒸馏(LOPD),旨在帮助 AI 智能体将经验直接融入自身策略。LOPD 不依赖设计者预先制定的特权信息,而是端到端学习这类上下文:系统检索相关经验,并将其组合为连续潜在 token,用于调节自教师模型。学生模型根据任务和交互历史生成轨迹,并在每个访问过的前缀位置获得密集的 token 级监督。研究还引入特权边际目标,以提升训练稳定性。在智能体工具使用和代码生成实验中,LO

AI视频生成平台Higgsfield获高盛、英特尔等4亿美元融资,估值达54亿美元

据英国《金融时报》报道,AI视频生成平台Higgsfield已从DST Global、高盛、Liberty Global、英特尔等投资者手中筹集4亿美元,估值升至54亿美元。这家成立仅两年的初创公司计划利用资金拓展企业订阅业务,加强安全能力并 확보算力资源。Higgsfield称,其年化收入在今年8月达到7亿美元,约一年前仅为2000万美元;平台目前在238个国家和地区拥有超过3000万用户。公司

MobileMem:从一年的移动体验中学习

MobileMem 是一个用于研究设备端 AI 智能体长期记忆的基准和框架。它基于为期一年的移动体验数据,并通过知识驱动的合成流程,从用户与应用的交互会话中构建连贯且具有时间一致性的长期轨迹。该基准涵盖文本和多模态场景,评估多跳推理与时间推理、知识更新以及隐式偏好推断。MobileMem 不仅关注对孤立事实的检索,还评估智能体能否记住过去、理解现在,并随着时间推移适应用户。

PRM-as-a-Judge 1.5:机器人流程评估工具包

PRM-as-a-Judge 1.5是一套用于精细评估机器人操作流程的工具包。它将执行视频转换为密集的进度曲线,并提供衡量失败过程进展、性能下滑后恢复能力以及成功执行质量的多项指标。项目还推出RoboPulse++,用于测试流程奖励模型的可靠性。该套件包含基准测试、指标实现和可视化工具,支持对具身模型进行透明且可复现的评估。

支持澳大利亚青少年社交媒体禁令的报告存在多处引用错误,机构承认曾用 ChatGPT 编辑

一份旨在评估年龄验证技术、协助澳大利亚执行未满16岁用户社交媒体禁令的报告,被发现至少存在6处引用错误。负责测试的英国机构 Age Check Certification Scheme(ACCS)承认,曾使用 ChatGPT 改写部分段落以使表述更简洁,此前该机构一度否认使用人工智能。ACCS称,AI没有用于生成研究、报告或参考文献,所有链接都经过人工核查。但《卫报》发现,部分 DOI 不存在或指

研究显示,仍具活性的成人脑组织可控制机械手弹奏音符

法国研究团队称,他们将取自已故成年人的活性脑组织接入了由电极、麦克风和机械手组成的闭环系统。这些被称为 OPAB 的脑组织外植体接受训练,将三个音符与三根机械手指的动作建立关联。在 16 个样本中,平均模仿准确率从第一天的 31.2% 提升至训练三天后的 58.5%。其中 62.5% 的样本至少学会了两个音符,部分关联在 17 天后仍然保留。研究人员认为,这种能力源于脑组织内部神经连接的变化,而不

将生成作为辅助监督,在不增加推理开销的情况下提升视觉理解

该研究提出GAS,一种面向多模态大语言模型的训练框架,将视觉生成重新定义为表征学习的辅助监督。GAS在解耦的Mixture-of-Transformers架构中采用下一嵌入预测,通过生成任务增强共享视觉路径,同时避免生成梯度直接干扰上层理解模块。训练完成后,生成分支会被移除,因此推理阶段无需额外计算。实验表明,GAS能够提升多模态理解能力,其中在视觉感知和空间理解方面的收益最为稳定。