OpenAI与Anthropic在澳大利亚听证会上承诺加快披露安全事件
在澳大利亚举行的一场听证会上,OpenAI首席战略官杰森·权承诺,今后将更快披露安全事件。Anthropic的代表也作出了类似承诺。报道没有提及具体的新要求或执行机制。
AI 新闻中心 过去24小时分析了 173 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
在澳大利亚举行的一场听证会上,OpenAI首席战略官杰森·权承诺,今后将更快披露安全事件。Anthropic的代表也作出了类似承诺。报道没有提及具体的新要求或执行机制。
摩根大通连续第五年被评为全球人工智能应用最先进的银行。年度排名显示,该行扩大了对竞争对手的领先优势,而整个行业的AI部署也在加速。
企业正在测试AI服务的订阅模式,但消费者的付费意愿似乎有限。仅靠订阅模式可能不足以吸引客户或维持需求。
一项研究测量了分割学习过程中传输的激活值和梯度能够泄露多少文本。在 GPT-2 实验中,拥有公开权重的攻击者仅凭激活值就能恢复 94.20% 的词元;若同时获得梯度,比例升至 97.38%。32 个词元的文档被完整恢复的比例则从 13.71% 升至 37.77%。Secret mixup 防御几乎阻止了整份文档被准确恢复,但仍有 83% 至 91% 的词元可被还原。研究表明,激活值和梯度都可能泄露
UndoBench 是一项基准测试,分别衡量 AI 智能体在正常情况下完成任务的能力,以及从故障中恢复的能力。测试涵盖 8 个企业领域中的 36 个工作流和 36 种故障场景。在 2,880 组配对试验中,常规任务能力为 83.54%,条件恢复成功率则为 46.72%。简单重试在 53.33% 的试验中造成外部效果重复。研究显示,恢复风险会随执行阶段而变化;如果只评估任务是否完成,这些风险可能被掩
评估文本与图像的对齐程度有助于检验图像说明、检测幻觉、筛选数据以及评测文生图模型。研究人员提出了无需额外训练的评估指标 DEPICT。它比较基于图像得出的答案与仅根据说明得出的答案,并根据说明能否明确决定答案来为问题加权。与整体评分结合后,DEPICT 对否定表达的准确率从 19% 提升至 88%。在五项基准测试和三个模型系列的 11 个骨干模型上,DEPICT 优于所有受测的免训练指标;在衡量与
在许多量子化学工作流程中,几何优化计算成本较高,因为每一步都需要进行力评估。在这项研究中,语言模型代理重写了优化器本身,以减少力评估次数。由此得到的 AutoSella 系列包含两种优化器;在搜索过程中未使用的分子基准测试和势能函数上,两者所需的力评估次数都稳定低于 Sella。在 r2SCAN-3c DFT 层级,最佳变体只需 Sella 的 40.2%至77.2%的力评估次数,就能达到相同的能
波兰竞争与消费者保护办公室(UOKiK)正在调查谷歌是否在与当地出版商协商报酬时滥用市场地位。调查聚焦谷歌如何确定和协商其搜索、谷歌新闻及 Discover 中新闻文章与摘要片段的报酬。UOKiK称,出版商缺少评估报价所需的数据,妨碍了公平谈判。谷歌表示正在审查相关指控,并称已与70多家波兰新闻媒体签订许可协议。若被认定违规,谷歌可能面临最高相当于营业额10%的罚款。该调查独立于欧盟针对出版商内容
AI让员工工作得更快,但大多数企业并没有因此变得更赚钱。差异取决于围绕工具构建的系统,而不是工具本身。1987年,诺贝尔经济学奖得主罗伯特·索洛指出,计算机时代随处可见,唯独没有体现在生产率统计中。近四十年后,AI也呈现出类似的悖论。
随着投资者重新买入这家人工智能芯片制造商,英伟达即将成为首家市值达到6万亿美元的公司。
自回归视频扩散模型擅长生成短视频,但生成长视频时,颜色和纹理可能逐渐漂移,运动也会失去连贯性。ID-Forcing 是一种推理时框架,通过使键值(KV)缓存及其使用方式与训练配置保持一致,来缓解这一问题。其自缓存机制可从源头避免缓存条目偏离训练分布。评测结果显示,该方法相比以往方案显著减少漂移,并能将短时长模型扩展到生成数分钟的视频。
CurveCodec 2使用小型学习模型高效编码残差,从而压缩骨骼动画。它依据历史数据预测量化曲线,并按照率失真标准选择关键采样点。每段解码后的动画都要通过两种误差约束之一:每个关节的最坏情况误差,或每段动画的平均误差。在涵盖33个数据集、共4,472段动画的测试中,采用ACL默认精度并满足最坏情况误差约束时,所需字节数为ACL的0.37倍;满足平均误差约束、精度较低时则为0.22倍。解码可在单个
一项研究分析了测试时训练(TTT),即模型在推理过程中将信息存储到自身权重中。当模型使用自己生成的文本进行学习时,在最长达12.8万令牌的文本流上,其对独立的人类书写文本的预测性能会下降。该现象在三种 TTT-E2E 配置以及更新 Qwen3-4B 现有权重时均会出现。受控对比表明,让冻结的模型生成训练片段,可在较小配置中消除超过98%的损害。更新虽然提升了模型对来源文本的预测,却会损害其对新真实
SearchJev 是一种快速且经过校准的模型,用于处理搜索智能体中的短决策,例如判断相关性、证据是否充分以及选择下一步搜索操作。它不进行自回归文本生成,而是直接为合法选项评分;规划、查询生成和答案撰写则交由 System-2 模型完成。研究人员提出了用于校准决策的软标签学习方法,并推出整合六类搜索决策的 SearchDecision-Bench。在该基准测试中,SearchJev 的决策速度比同
研究人员提出了 Prior-Fitted Language Model(PFLM),这是一个拥有3亿参数、仅使用合成非语言数据预训练的 Transformer。尽管从未见过任何真实语言,模型在冻结权重的情况下,仍能根据真实文本的前缀推断上下文中的语言。在六种语言的维基百科文本上,随着上下文长度增加,其每字节比特数显著下降。模型还能够学习数字规律、比较大小、近似加法,预测确定性序列,并在源代码、语音