AI 新闻中心

AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

StateFlow:构建、演化和访问用于预可视化的三维世界状态

StateFlow是一种面向电影、游戏、建筑和城市设计的人工智能预可视化研究框架。它不在每次修改时重新生成完整场景或视频,而是维护一个持久、可编辑的三维世界状态,其中包含场景元素、几何结构、外观以及摄像机配置。系统通过三个阶段构建、演化并访问这一状态:将生成的二维内容提升为一致的三维世界,把用户意图转化为保留世界记忆的结构化状态变化,并利用渲染反馈优化摄像机运动轨迹。在需要更高视觉保真度时,还可以

调查显示,FDA批准的乳腺癌诊断AI未达到放射科医生预期

《Clinical Imaging》发表的一项调查显示,对乳腺影像学会215名成员的调查发现,乳腺癌检测AI工具在临床实践中的实际效果低于放射科医生预期。约半数受访医生已经使用FDA批准的系统,另有11%计划引入,但多数仅将AI视为辅助性的“第二诊疗意见”,很少有人把它作为决定性因素。仅35%的医生观察到召回率下降,低于59%的预期;仅9%发现不必要的活检减少,远低于36%的预期。感到职业倦怠减轻

智能体安全应通过运行时契约来强制执行

作者认为,仅通过 RLHF、DPO 或 Constitutional AI 在训练阶段植入安全性,对于能够执行代码、修改文件、发送消息和变更数据库的自主智能体而言并不充分。他们提出由智能体运行框架强制执行的运行时契约,将沙箱、权限控制、输出过滤和轨迹监控等预防措施,与要求测试结果、日志、文件差异和有依据引用等可验证证据的核验机制结合起来。研究参考了对 52 起 AI 智能体和大语言模型安全事件、3

Spark-to-Paper:以可组合技能实现端到端研究论文生成

Spark-to-Paper是一套端到端研究论文生成系统,以13项可组合技能集成在现有编程助手中。系统能够检索文献、规划并执行实验、生成可编辑图表,并依据测量结果修改论文论断。它结合确定性的完整性检查与自我批评,用于检测捏造内容,并限制实验不断否定原始研究目标的失败循环。在8个受控研究主题中,系统取得99.5%的引文有效率和96.4%的图表可编辑率。消融实验显示,完整的完整性与审查机制可将捏造检测

ToolHazard:用于评估和对齐基于大语言模型的智能体的可扩展对抗环境

与外部工具集成的大语言模型智能体容易受到嵌入环境状态中的间接提示注入攻击。ToolHazard是一种可扩展的对抗环境合成框架,旨在减少人工工程工作。它结合环境模拟器、攻击者智能体和用户模拟器,生成可执行的有状态环境,发现可行的注入点,生成针对具体环境的攻击载荷,并构建基于环境状态的长程任务。研究人员基于该框架建立了ToolHazard-Bench,用于在复杂工作流和多种环境攻击下进行压力测试。实验

CoreWeave与Supermicro业绩向好,推动科技股上涨|Bloomberg Tech,2026年8月12日

彭博社的埃德·卢德洛分析了CoreWeave和Supermicro的积极业绩。两家公司的销售继续受益于蓬勃发展的AI需求。Silicon Data也筹集了新资金,并计划用于建立独立的AI计算性能基准。同时,投资者押注AI音乐初创公司Suno有望成为下一个Spotify,但外界仍担心其可能涉及版权侵权,以及低质量AI生成音乐不断泛滥的问题。

SpaceXAI 发布 Grok 4.6,剑指 GPT-5.6 Sol

SpaceXAI 发布了 Grok 4.6,称新模型在 Grok 4.5 基础上强化了长时间运行的智能体任务、复杂交互、视觉工作、编程和知识工作能力。根据公司信息,Grok 4.6 在综合九项基准测试的 Artificial Analysis Intelligence Index 上取得了与 GPT-5.6 Sol 相同的成绩。该模型已上线 Cursor、Grok Build,并通过 API 及

比亚迪 AI 团队首次亮相:HyWorldVLA 在自动驾驶基准测试中获 90.59 分

比亚迪新技术研究院 AI 团队发布首篇研究论文,介绍用于自动驾驶的混合世界模型 HyWorldVLA。该模型结合像素级与潜在空间世界建模,并采用视觉—语言—动作(VLA)架构。在 NAVSIM v1 公开基准测试中,HyWorldVLA 获得 90.59 分 PDMS;在更全面的 NAVSIM v2 中获得 89.71 分,报道称两项成绩均为该基准历史最佳。训练阶段,模型利用像素级预测作为监督机制

专家警示医学生过度依赖 AI:或从一开始就无法形成临床推理能力

专家警告,医学生过度依赖 AI,可能不只是诊疗技能退化,更可能从一开始就无法真正形成这些能力。斯坦福大学医学院学生与约翰斯·霍普金斯医院外科医生指出,AI 已深度进入临床工作流程。相关数据显示,美国约三分之二的医生正在使用临床聊天机器人 OpenEvidence。与此同时,《Nature Medicine》发表的一项研究发现,部分医疗专用大语言模型回答医疗问题时,表现反而不如 ChatGPT 和

InSight-doc:面向长文档理解的智能体视觉感知

InSight-doc 是一个用于理解视觉内容丰富的长文档的智能体框架。系统从低分辨率开始处理,仅对需要更详细证据的相关区域进行选择性放大,并且不依赖外部检索器。其训练数据包括17,900条带有区域级缩放轨迹的高质量监督微调样本,以及19,200条高难度强化学习样本。InSight-doc-8B在文档视觉问答基准上的准确率较基线提升4.3至16.4个百分点。在长文档场景中,该系统在保持准确率优势的

Power-Law Graph Attention:缩放点积注意力的精确推广与推理时的经验性坍缩

该研究提出 PLDR-LLM 及其 Power-Law Graph Attention 机制。该机制用由输入生成的算子取代缩放点积注意力固定的双线性形式,算子由正张量和逐元素幂律构成。研究证明,PLGA 将标准注意力精确地包含为特殊情况,并分析其 Perron–Frobenius 结构、无环约束以及保持相对位置依赖性的条件。推理坍缩定理指出,如果演绎输出对输入完全不变,该机制将退化为使用常数算子的