AI 新闻中心

AI 新闻中心 过去一年分析了 8908 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

微信测试“按住转文字”功能引发热议,iOS和安卓用户先体验,鸿蒙版仍需等待

微信近期小范围测试一项新的聊天输入功能:用户按住输入框说话,语音会实时转换为文字,松手后自动发送。发送前,用户可以编辑文字,也可以上滑取消。该功能将原本独立的麦克风按钮整合进输入框,目前仅面向部分 iOS 和安卓用户灰度开放。部分用户认为它提升了输入效率,尤其适合不便打字的场景;但也有用户担心误触,并不满于目前无法手动关闭。根据反馈,该功能的识别准确率暂时不如先录音再转换文字。腾讯客服表示,鸿蒙客

迈向量化 ASR 模型的基准优化

一项研究提出了一种方法,用于衡量自动语音识别模型是否针对公开基准进行了优化,却没有相应提升通用转录能力。研究关注音频本身无法唯一确定参考文本,或音频与基准参考文本相矛盾的情况。通过参考文本不一致、遮蔽数字恢复和正字法切换三类行为探测,研究发现,表现最好的开源模型即使面对矛盾、被遮蔽或含糊的音频,也会逐字输出基准参考文本片段。机制分析表明,模型会依赖狭窄的声学线索,选择有利于基准成绩的策略,而不是忠

EXIMO:视觉语言模型引导的VLA策略探索

EXIMO是一种用于高效微调视觉—语言—动作模型(VLA)的方法,面向机器人操作任务。该方法分为三个阶段:视觉语言模型负责规划并拆解复杂的长期任务;系统利用这些规划结果收集组织化数据,并通过模仿学习微调VLA策略;最后使用残差离策略强化学习进一步优化。EXIMO旨在减少对昂贵远程操作数据的依赖,并缓解强化学习在长期任务中的样本效率问题。作者在实验中报告称,该方法在样本效率和最终性能方面均显著优于现

知名 YouTube 创作者因接受 AI 资金遭到反弹

过去几天,包括 Matti Haapoja 和 Sam“​​Kold”Kolder 在内的多位知名影视内容创作者发布视频,展示 AI 平台 Higgsfield 的能力。视频重点介绍了该平台近期新增的 Seedance 2.5 功能,并将这些技术宣传为视频制作的未来。随后,相关创作者因疑似接受平台付费推广而受到批评,外界也对赞助关系是否充分披露以及这类推荐的可信度提出质疑。

生成式人工智能真的会复制艺术家作品吗?研究人员称仍有争议

麻省理工学院研究人员探讨了“归因衰减”这一概念,以及它对希望保护作品的艺术家可能产生的影响。生成式人工智能长期被指控直接复制艺术作品,相关版权诉讼正在多地法院审理。MIT的一项新研究提出了不同且更细致的观点,可能使法院评估此类案件时面临更复杂的法律问题。

社交媒体曾在青少年之后扩张,如今人工智能也在重走这条路

29名美国州检察长起诉Meta的同一周,OpenAI推出了面向青少年的ChatGPT。诉讼指控Meta明知故犯地将Facebook和Instagram设计成容易让儿童上瘾的平台,误导公众了解这些平台对年轻用户的危害,并在未获得家长同意的情况下非法收集13岁以下儿童的数据。这些事件引发了更广泛的疑问:为什么更强的保护措施往往要等到一项技术被大规模采用之后才出现?

青少年开发者借助 Claude Code,为冷门惠普打印机开发原生 macOS 驱动

青少年开发者 Kuber Mehta 借助 Anthropic 的 Claude Code,为缺乏 macOS 官方支持的惠普 Laser 1008a 打印机开发了原生驱动。该 AI 编程代理协助分析现有软件、逆向打印流程,以及编写和修正代码,约 4 小时便让打印机在 macOS 上运行。最终版本不再依赖惠普专有组件或 Linux 容器,而是采用修改后的开源 SpliX 打印引擎和原生 macOS