分析:保险业为失控AI代理可能引发的数百万美元索赔做准备
保险公司和律师正在评估失控AI代理可能引发的大型诉讼及赔偿成本。分析还探讨了OpenAI首席执行官萨姆·奥特曼、Anthropic首席执行官达里奥·阿莫代等高管是否可能被追究个人责任。
AI 新闻中心 过去24小时分析了 173 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
保险公司和律师正在评估失控AI代理可能引发的大型诉讼及赔偿成本。分析还探讨了OpenAI首席执行官萨姆·奥特曼、Anthropic首席执行官达里奥·阿莫代等高管是否可能被追究个人责任。
AMD CEO苏姿丰10月5日抵达台湾,行程包括会见客户和供应链伙伴。她表示,10月6日上午已与鸿海董事长刘扬伟会面,下午计划拜访台积电。苏姿丰称,2026年计算市场需求强劲,仍远高于供给;AMD正扩大产能,预计2027年将大幅增产。AMD对台湾供应链的新台币100亿元投资计划进展符合预期,公司也可能因需求增长而追加投资。为补充台积电CoWoS先进封装产能,AMD还在评估其他先进封装技术。
随着 AI 自动化过去常由职场新人承担的任务,年轻从业者陷入两难:他们被要求评判 AI 的成果,却失去了培养所需判断力的机会。毕业生的抱负或许没有改变,但他们进入的就业市场已截然不同。
Code2Games是一种智能体框架,可将自然语言描述的游戏构想转化为结构化游戏世界。它协调场景分析、玩法规划与世界生成,随后将结果适配到Unreal Engine 5。执行引导式重建流程利用编译诊断、运行时反馈和游戏测试,解决引擎适配过程中出现的不一致。研究人员还推出了GameCode4D基准,包含十个游戏提示。在实验中,与所评估的基线方法相比,Code2Games提升了生成世界的视觉质量和交互
MemAdapter 是一个旨在减少 LLM 智能体利用存储记忆时过度认同用户既往观点的框架。它通过反事实推理评估检索记忆的潜在风险,根据当前任务调整各条记忆的影响,并以适当证据为回答提供依据。研究人员称,在三个基准测试中的实验显示,该方法能够提升记忆可靠性。代码已公开。
据报道,一辆汽车在沪昆高速安顺段以每小时120公里行驶时,导航辅助驾驶(NOA)在距离前方大货车约10米处突然退出并要求驾驶员接管,随后发生追尾。驾驶员称,当时已没有足够距离制动。近年来已有多起类似事件。报道提醒,目前市售车辆搭载的相关功能属于L2级及以下辅助驾驶,驾驶员仍须持续关注路况并承担责任。若因分心导致事故,驾驶员可能面临民事、行政及刑事责任。
DeepSeek即将完成最新一轮融资,金额至少为800亿元人民币(120亿美元),超过其自身设定的融资目标。这轮融资预计将在公司计划于2027年初进行首次公开募股之前完成。
AI智能体生成科学代码的能力不断增强,但仅仅生成代码并不能改进底层算法。研究提出自动诊断与技能发现(ADSD)框架,先分析数值求解器表现不佳的原因,再依据诊断结果寻找合适的数值方法,并将所得知识整理为可复用的求解器技能。在电力潮流计算、刚性常微分方程和扩散偏微分方程等四个领域,ADSD提升了求解器的准确性、稳健性和效率。研究人员称,在GOC-500电力潮流测试中,求解器平均误差降低了近71倍;这一
这项研究推出 ACG-Bench,用于评估双臂策略能否以新方式重新组合已掌握的基础技能。基准包含八个任务族中的 23 组任务与条件,涵盖未见过的顺序安排、同步要求及跨任务组合。研究人员使用相同的 π_{0.5} 主干模型,比较数据增强和架构策略。结合 SkillLoRA 与逐臂注意力的方法,在模拟中的泛化成功率为 21.53%,而单一 π_{0.5} 策略为 2.94%。在 SO101 机器人上的
意大利总理焦尔吉娅·梅洛尼已向欧盟知识产权局(EUIPO)申请将自己的声音注册为商标,以应对 AI 生成的深度伪造内容。申请目前仍在审核中,材料附有一段她说出自己姓名的 4 秒录音。声音商标无法彻底阻止伪造音频,但可能为模仿她嗓音的人增加法律障碍。梅洛尼还对一名被指利用她的形象制作并发布虚假色情图片的男子提起了民事诉讼。
智能体 harness 定义了解决任务所需的角色、指令、工具和通信结构。由于只有执行后才能观察其效果,过去针对每个查询调整 harness 通常需要运行多个方案或进行昂贵的人工设计。研究人员推出 SHIFT,利用搜索结果训练本地大语言模型构建 harness,并根据准确率和执行成本预测其效用。对于每个查询,系统通过蒙特卡洛树搜索构建 harness,无需实际运行多个备选方案。在六个基准测试的 9,
OmniConfess是一种无需训练的全模态幻觉缓解方法。它固定一个候选回答,并在受控调整各输入通道证据的同时,逐Token重新评分,从而生成结构化结果,揭示回答各部分依赖哪些文本、图像、音频或视频证据。该方法利用这些信息保留有依据的内容,并修正由无关或矛盾证据驱动的判断。研究团队还构建了OmniHalluBench,包含来自六个数据集的3,540个样例,覆盖文本、图像、音频和视频场景,以及判断和
一项研究使用过去四年发布的十种生成模型,评估了二十种深度伪造检测器。检测准确率从接近 99.5% 降至 76%;加入针对性扰动后,所有基线检测器的准确率都低于 2%。研究人员提出一种经过校准的替代方法,用于评估内容的真实性是否可能被合理质疑:如果已知生成模型能够忠实地重现内容,那么其合成来源就具有合理可能性。该方法可校准至误将生成内容认证为真实的比例不超过 1%。使用受攻击样本校准更严格的阈值后,
一项研究发现,在迭代去噪过程中,可以将扩散语言模型引导至偏向特定人口群体的回答。攻击者使用比例-积分(PI)控制器跟踪目标答案的概率,并动态调整引导向量。在BBQ的模糊问题上,LLaDA-8B-Instruct对目标群体的偏好提高了1.8至16.7个百分点;在SocialStigmaQA上,污名化回答的比例从17.6%升至58.1%。研究指出,生成过程中的内部激活可能成为攻击途径,因此偏见审计还应
RealtimeWAM是一种世界动作模型(WAM),旨在通过单步生成动作和异步推理提升效率,针对动作反复去噪以及视频专家与动作专家之间的等待两项瓶颈。Teacher-Anchored Consistency Distillation在局部一致性训练之外,引入冻结教师模型多步推演的最终输出,以提升单步动作生成的准确性。Cross-Expert Wavefront Pipelining通过共享视频KV