美国财长反对给予人工智能实验室责任豁免,呼吁开发更多美国制造的开源模型
美国财政部长斯科特·贝森特在众议院听证会上表示,不应给予人工智能实验室责任豁免。他还呼吁在美国开发更多开源人工智能模型。贝森特对众议院金融服务委员会议员表示,确保安全的最佳方式是让人工智能开发者对其系统承担责任。
AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
美国财政部长斯科特·贝森特在众议院听证会上表示,不应给予人工智能实验室责任豁免。他还呼吁在美国开发更多开源人工智能模型。贝森特对众议院金融服务委员会议员表示,确保安全的最佳方式是让人工智能开发者对其系统承担责任。
E2A-Bench是一个包含969个查询的基准测试,用于评估视觉语言模型能否将金融图表证据可靠地转化为行动建议。该基准覆盖HS300指数的323家成分股,并使用从OHLCV数据中确定性生成的证据锚点。评估指标包括依据性、推理与行动的一致性、置信度校准和方向覆盖率。对20个视觉语言模型的测试发现,单一的幻觉评分会掩盖一些问题:方向覆盖率过低可能导致模型排名靠后;预言机辅助验证虽然能减少无依据的陈述,
Ars提前查看了Mozilla一份关于主流AI模型成本与能力差距的报告。报告称,付费前沿模型相较于便宜得多的开放模型,领先时间仅约4个月,但成本却高出约5倍。研究结果表明,开放模型正在迅速追赶商业系统的能力。
Salesforce 与英伟达在 Dreamforce 大会上发布了 Koa,这是 Salesforce 首款大规模推理模型。Koa 基于英伟达开源权重的 Nemotron 模型打造,并针对销售、营销和客户服务任务进行了微调。Salesforce 表示,训练过程中未使用真实客户数据,而是采用合成业务数据。Koa旨在为企业提供 Claude、ChatGPT 等闭源模型之外、更易控制的替代方案,同时降
Salesforce Koa基于英伟达的开放权重模型Nemotron构建,并针对销售、营销和客户支持任务进行训练。现有信息尚未证明该模型具备行业领先性能,也不足以表明它将从根本上改变人工智能开发。
ModaLens 评估:当模型已经获得放射学报告时,医学视觉语言模型是否仍真正使用影像。研究人员在 MIMIC-CXR 的 3,199 个配对病例中替换图像,同时固定问题和报告。对于 MedGemma-27B,有报告时生成答案仅在 4.26% 的试验中发生变化;没有报告时则为 20.94%,配对差异为 16.7 个百分点。相同方向的结果在另外两个模型系列中得到复现。由于标签来自报告,研究结果不能直
一名 Reddit 网友表示,他使用阿里巴巴开源的 Qwen3.8-27B 模型,在一张超频 RTX 3090 上耗时约 5 小时,开发出一款可玩的第一人称僵尸射击游戏。测试采用 Q4KM 量化版本和两套 Harness 方案,并通过 MSI Afterburner 对显卡进行超频,据称性能提升约 12%。Q4KM 通常指 GGUF 格式中的 4 位混合量化档位。这一项目展示了模型在本地编程场景中
上海人工智能实验室开源了多模态基础模型 Intern-S2。实验室称,该模型的通用能力位居开源模型前列,并在生物、材料科学和化学等长程科学任务上达到可与顶尖闭源模型相比的水平。其核心架构是 Memory Decoder,支持插拔式专业记忆模块。针对特定领域,用户可以更换相应记忆模块,而无需重新训练整个模型,同时保留原有的通用能力。Intern-S2 还强化了长程推理和智能体工具执行能力,这些能力对
开源项目 CUDA-for-AMD-Windows 可让 Windows 平台上的 AMD 显卡运行部分 CUDA 库。该项目结合 ZLUDA 翻译层与 AMD 的 HIP、ROCm,将 CUDA 驱动程序 API 以及 cuBLAS、cuSPARSE 和 cuFFT 等库映射到 AMD 对应组件。在概念验证中,开发者使用未修改的 CUDA 库,通过 Radeon RX 9060 XT 完成了一个
计算机使用代理正越来越多地操作浏览器、终端、文件系统和外部服务,由此产生的安全风险往往在运行过程中出现,而不仅存在于生成内容中。HazardAuditor在受控环境中运行Claude Code、Codex、Hermes和OpenClaw等不同代理,并将其交互统一为标准事件表示,以支持跨框架监督。研究人员还提出Guard Policy Optimization,解决基于词元的训练目标容易让较长推理过
盖茨基金会计划在未来两年投入10亿美元发展人工智能,重点是让贫困地区也能获得技术红利。比尔·盖茨在采访中高度评价中国人工智能的发展,称中国和美国各自都有至少四家机构的大模型能够保持最先进水平,但没有透露具体名称。他认为,开源模型对发展中国家尤其重要,并建议技术领先国家拿出数据中心5%的算力,作为数字援助免费提供给贫困国家。盖茨还讨论了数据中心排放、硬件价格上涨、AI对就业的影响以及社会不平等。他表
ZGCM-1 是一个完全开放、从零训练的 70 亿参数稠密型基础模型,面向数学推理和智能体搜索。其训练方案支持 256K 上下文,结合交错式门控滑动窗口注意力与全注意力机制,并采用 FP8 Muon 优化器和分阶段上下文扩展。该模型通过有意推理和调用外部工具,弥补小型模型参数容量有限的问题。研究团队称,ZGCM-1-7B 在通用基准测试中具备与同规模 7B 模型竞争的性能,并在部分数学推理和智能体
PhysBrain 1.5 是一个用于理解物理环境、生成动作和预测未来状态的统一模型。它将语言响应、末端执行器运动和视觉目标编码为离散序列,并通过自回归下一词预测进行联合训练。预训练完全采用人类交互视频,随后使用人类示范、机器人轨迹和模拟经验进行监督微调。作者称,这个拥有80亿参数的开源模型在28项具身理解基准测试中平均得分72.5,并在其中14项取得开源模型最佳成绩。这些性能数据属于作者报告,仍
Attention-DP3是一种三维扩散策略,旨在帮助机器人在物体遮挡、混杂且干扰物较多的操作场景中识别与任务相关的几何信息。该方法首先对RGB图像进行开放词汇二维分割,再利用经过标定的相机几何将目标物体掩码提升到三维空间。其三场注意力条件机制分别强调目标物体、目标内部与任务相关的区域,并抑制背景和干扰物。 在Adroit、DexArt、MetaWorld以及真实SO101平台上的实验显示,该方法
该研究提出“发现基础模型”,这类 AI 系统不仅能够利用现有知识进行推理或解决人类定义的任务,还能参与提出新问题、构建新表示、形成假设并创造知识。其框架 Zetema 维护可修订的研究状态,验证证据、控制实验,并跨任务持续改进发现能力。GALILEO 将干实验室推理、机器人和实际湿实验室实验、外部生物学证据以及反复的假设修订结合起来,应用于治疗研究。研究还提出了超越最终答案准确率、训练和评估发现过