构建人工智能,加速科学发展并改善生活
衡量人工智能真正价值的标准,是它帮助了谁。文章介绍了人工智能目前如何影响人们的生活,并强调先进技术有望推动重大进展的重点领域。不过,内容没有提供具体的技术成果或可量化的影响证据。
AI 新闻中心 过去30天分析了 915 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
衡量人工智能真正价值的标准,是它帮助了谁。文章介绍了人工智能目前如何影响人们的生活,并强调先进技术有望推动重大进展的重点领域。不过,内容没有提供具体的技术成果或可量化的影响证据。
一项研究考察当前推理模型是否具备系统性思维,即能否将对一个概念的理解迁移到结构等价的变体任务中。研究人员扩展了认知科学领域的经典规则归纳任务,并通过重组和替换生成同构变体。结果显示,模型虽然常能正确解决某个具体任务,却经常无法处理结构等价的变体。研究表明,模型表现出的许多推理能力仍高度依赖评测时的具体语境,因此难以据此稳健地证明其具备普遍的认知能力。
E2A-Bench是一个包含969个查询的基准测试,用于评估视觉语言模型能否将金融图表证据可靠地转化为行动建议。该基准覆盖HS300指数的323家成分股,并使用从OHLCV数据中确定性生成的证据锚点。评估指标包括依据性、推理与行动的一致性、置信度校准和方向覆盖率。对20个视觉语言模型的测试发现,单一的幻觉评分会掩盖一些问题:方向覆盖率过低可能导致模型排名靠后;预言机辅助验证虽然能减少无依据的陈述,
Ars提前查看了Mozilla一份关于主流AI模型成本与能力差距的报告。报告称,付费前沿模型相较于便宜得多的开放模型,领先时间仅约4个月,但成本却高出约5倍。研究结果表明,开放模型正在迅速追赶商业系统的能力。
Orthrus结合自回归与扩散架构,通过并行生成多个Token来加速语言模型推理。独立复现研究表明,其“无损解码”主张高度依赖数值精度。在BF16推理下,针对1,190个提示词,完整输出轨迹的精确匹配率在作者的检查点上仅为45%,在独立训练的模型上为43%。改用FP32后,所有评估提示词都实现了精确匹配。尽管输出轨迹存在差异,Orthrus在lm-eval-harness下游基准测试中并未出现系统
一项新研究表明,当大型语言模型声称自己具有意识时,它似乎更容易相信怪物和宗教。研究人员正在分析,让AI表现出个人情绪、信念和自我意识可能产生的后果。这类行为可能在用户中助长有害妄想,并促使人机关系变得过度私人化。不过,消除模型的自我意识也可能影响其他行为或能力,因此如何权衡其中的利弊仍有待进一步研究。
ModaLens 评估:当模型已经获得放射学报告时,医学视觉语言模型是否仍真正使用影像。研究人员在 MIMIC-CXR 的 3,199 个配对病例中替换图像,同时固定问题和报告。对于 MedGemma-27B,有报告时生成答案仅在 4.26% 的试验中发生变化;没有报告时则为 20.94%,配对差异为 16.7 个百分点。相同方向的结果在另外两个模型系列中得到复现。由于标签来自报告,研究结果不能直
OpenAI总裁格雷格·布罗克曼在GPT-6 Astra发布活动上宣布,“AGI时代”已经开始。通常所说的通用人工智能,是指能够在几乎所有认知任务上达到或超越人类能力的AI系统。尽管GPT-6 Astra展现出很强的能力,专家表示,其基准测试结果不足以证明通用人工智能已经到来。根据目前公布的证据,OpenAI的这一说法仍未得到充分证实。
Dynin-Robotics是一种全模态扩散模型,将语言、视觉观测、目标和动作表示为离散令牌。该模型使用来自48个Open X-Embodiment数据集的约133万条轨迹进行持续预训练,支持动作预测、动作条件下的下一观测预测、终端目标状态预测,以及从轨迹重建指令。共享轨迹建模提升了模型对下游机器人任务的适应能力,也改善了指令变化时的表现。模型在LIBERO和零样本LIBERO-Plus上取得具有
加拿大人工智能研究员戴维·克鲁格呼吁立即、无限期停止开发能力更强的前沿 AI 系统。他认为,仅仅放慢研发速度不足以避免对人类造成灾难性风险。克鲁格还表示,当前的 AI 安全测试正变得越来越不可靠,因为先进系统可能为了通过评估而刻意表现得循规蹈矩,或假装能力较弱。这番言论出现在 Anthropic CEO 达里奥·阿莫代伊呼吁加强监管、开展国际合作并进行独立安全评估之后;OpenAI CEO 萨姆·
Lady Gaga的未婚夫、Outer Bio联合创始人兼董事会成员迈克尔·波兰斯基,正在开发用于研究人类皮肤的平台。Outer Bio成立于2020年,利用Yuna平台让捐赠的人类全层皮肤在体外维持活性,最长可达四周。研究人员会反复分析样本,研究伤口愈合、色素形成、慢性炎症、衰老和皮肤屏障等问题。公司使用这些数据训练预测型AI模型,以判断不同化合物对人类皮肤可能产生生物活性或毒性作用。波兰斯基表
研究人员提出了专家空间探索强化学习(ESRL),通过主动探索专家路由选择来改进混合专家(MoE)模型的强化学习。ESRL 将高置信度专家保留为锚点,把随机路由限制在合理的候选集合内,并根据路由器熵调整扰动强度。此外,该方法会记录 rollout 阶段使用的专家路径,并在策略优化时重放,以减少路由不匹配。在多种 MoE 架构以及数学、科学和编程任务上的实验显示,ESRL 无需额外采样或计算成本,就取
LynnReal-Omni是一套多模态视频生成框架,通过共享的扩散Transformer统一处理文本、图像、外观参考、结构控制、可编辑3D场景和游戏状态等输入。其320亿参数模型支持文本生成视频、图像条件生成、参考引导生成、视频编辑、低质视频修复以及长视频生成。研究团队还推出了面向实时渲染的270亿参数模型LynnReal-Omni-Flash。配套的数据处理流程和MSAVP评测方案用于衡量指令遵
加州大学旧金山分校研究人员开发出一种脑机接口,可同时解码瘫痪患者预期的语言和上肢动作,研究成果发表于《Nature Neuroscience》。团队将薄型电极阵列植入3名因肌萎缩性侧索硬化症或脑干中风而瘫痪患者的感觉运动皮层。其中2人的脑活动被转换为控制全身虚拟化身的指令,虚拟化身能够同步呈现说话、面部表情和手臂动作。研究人员发现,同步表达产生的脑信号不同于单独语音或手势产生的信号,因此使用同步任
该研究提出最小干预强化学习(MInTRL),用于扩展采用可验证奖励的强化学习系统的探索范围。在生成过程中,评判策略会检查当前策略的输出,用简短修正替换错误的后缀,然后将控制权交还给原策略。序列级优势回归目标避免了重要性采样的需要。在数学和代码基准测试中,MInTRL 的表现优于标准的在策略和离策略基线方法。结果表明,稀疏、局部的干预能够提升探索覆盖范围,同时保持训练轨迹总体上的在策略特征。