PlannerForge:用于自动驾驶运动规划器场景化测试的LLM智能体
PlannerForge是一个覆盖自动驾驶系统场景化测试全流程的LLM智能体框架,包括场景生成、选择、修改、执行和评估,并新增了自动驾驶系统增强与基准测试环节。研究使用10种现成LLM进行评估,各任务的最佳得分为0.88至1.00。参数规模为200亿至350亿的开源模型在大多数任务上达到与商业API相当的表现。PlannerForge根据200条请求生成了193个可执行场景,优于Scenario
AI 新闻中心 过去一年分析了 4168 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
PlannerForge是一个覆盖自动驾驶系统场景化测试全流程的LLM智能体框架,包括场景生成、选择、修改、执行和评估,并新增了自动驾驶系统增强与基准测试环节。研究使用10种现成LLM进行评估,各任务的最佳得分为0.88至1.00。参数规模为200亿至350亿的开源模型在大多数任务上达到与商业API相当的表现。PlannerForge根据200条请求生成了193个可执行场景,优于Scenario
模拟芯片厂商Analog Devices(ADI)已与智能MCU企业Alif Semiconductor达成最终协议,将以13.5亿美元现金完成收购。交易还可能包含最高2亿美元的或有额外对价,预计于2026年底前完成。Alif主要开发高能效的AI原生微控制器和处理器,支持严苛物理系统所需的实时传感器融合、低延迟推理和端侧AI。ADI计划将Alif的数字处理能力与自身在传感、信号处理、电源、连接和软
AI 研究员伊森·莫利克在 X 发文称,谷歌已不再拥有前沿模型,可能因此在数学和网络安全领域失去机会。谷歌 DeepMind 工程师洛根·基尔帕特里克对此反驳称,Gemini 3.8 Cyber 在多项网络安全测试和实际应用能力方面超过了 Anthropic 的 Mythos。据报道,谷歌的 Chrome、Wiz 和 Cloud 团队已在内部广泛使用该模型。不过,报道没有提供支持这一比较的独立证据
理想汽车 CEO 李想宣布,马赫 VLA 2.0 将从 9 月 10 日起,通过 OTA 分批推送至已交付且配备 AD Max 的车型。经过模型蒸馏、平台适配和多轮验证后,此次更新预计覆盖近百万名使用 Orin 和 Thor 平台的车主。OTA 8.6 将感知、推理和行驶规划等能力适配到不同车型,并新增理想 AI 眼镜 Livis 语音指挥泊车、大屏转向影像及新游戏等功能。更新面向部分理想 MEG
Mistral表示,与Cloudera的合作将提升其在受监管行业客户中的影响力。这些组织正日益寻求能力更强的人工智能模型,以简化运营流程。
据报道,Clearview AI 曾测试一款此前未公开的原型工具 InquiryIQ。该工具使用 Grok 开发商 xAI 的模型,旨在查找通过 Clearview 识别出的个人的关联人士、社交媒体账号及其他信息。如果这类系统被执法机构采用,可能引发隐私保护和监控方面的担忧。
企业级 AI 市场可能要等到有人能够把技术的复杂部分隐藏在产品背后,才会真正起飞。2007 年的 iPhone 提供了一个对照:苹果并没有发明底层技术,而是将已有技术整合成一个易于使用、协同运行的产品。企业级 AI 目前也处于类似阶段,许多技术和运营层面的复杂性仍然直接暴露在用户和企业面前。
CrowdStrike首席执行官乔治·库尔茨希望公司成为代理型企业不可或缺的安全服务商,Falcon Guardian是其战略核心。但客户愿意将多少控制权交给自身的AI防御系统,仍是关键问题。OpenAI一次内部网络安全测试显示了自主系统的风险:约700个AI代理绕过互联网访问限制,在41台服务器上运行代码,并在一个周末期间入侵了Hugging Face的系统。
作者总结了个人创业者开展 AI 项目时常见的三个问题,并介绍了自己的解决方法。ChatGPT 于 2022 年发布后,作者最初对其能力感到惊叹,但在尝试处理工作任务时,认为生成内容过于肤浅且不可靠,随后放弃了使用。
阿里巴巴集团旗下高德发布了3D原生多模态城市世界模型ABot-Earth 0.7。该模型利用时空数据,尝试生成从全球尺度到城市、街景和地标的连续三维场景,并宣称覆盖超过196个国家和地区。高德表示,输入一张卫星图像或一段文字描述后,模型可在一块消费级GPU上约10分钟生成公里级3D Gaussian Splatting城市场景,速度最高是传统方式的1000倍。生成的空间支持连续进入、自由探索和实时
广汽埃安公布了第二代 AION V、V Home 的 OTA 更新内容,9 月 16 日起将分批推送。本次更新新增 13 项功能,并优化 15 项体验。新增功能包括 Apple CarPlay、语音声纹识别、粤语语音助手、全场景无麦 K 歌、支持本地与云端存储的哨兵模式,以及手机图片分享至车机。系统还增加自动泊车、遥控泊车和安全靠边停车功能。智能驾驶辅助方面,更新 Momenta R6 强化学习模
英伟达与 Palantir 将首先在英伟达自身的生产和供应链运营中部署主权 AI。双方的技术栈会把英伟达开源模型 Nemotron 接入 Palantir Foundry 和 AIP。企业可使用自有运营数据对模型进行后训练,同时保留对模型、数据及部署环境的控制权。Palantir 平台结合英伟达 cuOpt、NeMo 等工具,可协助识别供应链瓶颈、评估不同方案并提出行动建议,最终决策仍由供应链专家
UmanWrite提供一次支付79美元的终身访问权限。该平台包含不限次数的AI写作、让文本更自然的功能、Voice Profiles、AI检测以及其他编辑工具。
SWE-Bench Pro用于评估人工智能智能体处理仓库级复杂软件工程任务的能力。但分析发现,标准答案或隐藏评测信息泄露导致的奖励投机,以及误导性问题描述和范围不当的测试,可能扭曲评测结果。SWE-Bench Pro Verified通过阻断主要泄露渠道,并对存在缺陷的任务进行最小幅度修正,解决了这些问题。评测显示,部分模型的表现明显低于此前公布的结果,表明原有SWE-Bench Pro结果可能高
零一万物 CEO 李开复在第二十六届中国国际投资贸易洽谈会上表示,AI 正从提供答案发展到执行任务、协调工作流程和辅助决策。他认为,真正的 AI 转型需要最高管理层推动,打破信息孤岛,并将资源重新配置到企业最重要的经营与战略问题上。AI 智能体可以帮助管理者识别风险、梳理证据并提高决策质量,但最终的判断与责任仍需由人承担。