OmniAssistBench:面向 Omni-LLM 的助手式交互基准
OmniAssistBench 是一个用于评估多模态大语言模型作为实时视频助手能力的基准。与静态数据集不同,它测试模型能否在多轮交互中结合视觉状态、用户目标、先验知识和对话历史。研究人员通过逆向分析互联网上的现有视频,推导用户的逻辑目标,并构建沿预设交互路径进行的多轮视频片段。该数据集的建设耗费了超过 1,000 小时的专家工时。Gemini-3-Pro 得分为 66.4 分(满分 100 分),
AI 新闻中心 过去一年分析了 1377 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OmniAssistBench 是一个用于评估多模态大语言模型作为实时视频助手能力的基准。与静态数据集不同,它测试模型能否在多轮交互中结合视觉状态、用户目标、先验知识和对话历史。研究人员通过逆向分析互联网上的现有视频,推导用户的逻辑目标,并构建沿预设交互路径进行的多轮视频片段。该数据集的建设耗费了超过 1,000 小时的专家工时。Gemini-3-Pro 得分为 66.4 分(满分 100 分),
该研究提出了RecVerse,这是一种基于图形用户界面的智能体,用于模拟跨越多个页面的真实购物会话。为解决长会话中的记忆问题,系统采用受认知机制启发的分层记忆,包括工作记忆、会话内的情景记忆和高层次的偏好记忆。RecVerse还通过轨迹级强化学习目标进行优化,对完整会话而非单个动作进行评估,从而使模拟行为更接近真实用户。研究团队同时发布了USB,这是一个用于多轮用户模拟的交互式电子商务GUI轨迹数
AgentMercury 是一个研究框架,可根据高层级商业场景自动生成可执行环境。它不为单一任务构建环境,而是创建包含实体、服务、工具、状态以及可验证跨服务不变量的持久化世界。研究团队覆盖 14 个行业和 50 个国家,生成了 4,783 个环境,并将其用于强化学习训练。训练后,Qwen3.5-4B 在企业工作流以及推理、编程、科学计算和工具使用等域外基准测试中均有所提升。此外,对 Qwen3.5
OpenBMB开源了MathForm,这是一套用于将自然语言数学表述自动形式化为Lean4的框架、数据集和模型。系统结合检索机制与编译器、语义一致性引导的验证流程,并根据Lean的诊断结果最多进行三轮修正。FormalVerse数据集包含超过36.7万个经过验证的Lean4示例。根据公开测试,使用FormalVerse训练的模型一致性检查率达到60.32%,高于FineLeanCorpus的46.
大语言模型智能体正从语言生成器发展为能够执行复杂长期任务的自主系统。文章指出,当任务需要异质专业知识、并行子任务、独立验证和持久状态时,单个智能体的能力或上下文扩展会面临架构限制。作者提出“系统智能”概念,强调将多个专业智能体组织并协调到共同目标之下。“图工程”通过显式、动态且不断演化的图结构表示任务、智能体和系统状态,从而支持复杂目标的组织、异质智能体的协作以及系统演进。文章系统总结了这一范式的
CLEAR是一种大语言模型安全对齐方法,通过隐藏状态中的轻量级门控机制,连续控制安全低秩适配器的激活强度。该方法旨在减少有害回答,同时避免对良性提示下的基础模型进行不必要的修改。在Llama-3-8B-Instruct测试中,CLEAR将HarmBench攻击成功率从32.3%降至0.5%,并保留了模型大部分实用性。在GSM8K准确率方面,其表现也比全局应用的SFT或LoRA高出最多7.1个百分点
SuperCLUE发布了最新的手机端侧大模型评测结果。vivo蓝心BlueLM 3.5 Nano 3B以89.86分排名第一,据该评测,其表现接近多个主流云端模型。Qwen3.5 9B和Qwen3.5 4B分别以87.82分和85.16分位列第二、第三。端侧模型能够在手机本地处理文本和图像,无需持续联网,因而有助于提升隐私保护和离线使用能力。不过,手机硬件限制了模型规模,也限制了其处理复杂任务的性
谷歌表示,其开源模型家族Gemma的累计下载量已超过10亿次,开发者还基于该系列创建了超过10万个定制变体。Gemma目前被用于太空图像分析、医疗报告结构化和生物医学研究。谷歌DeepMind、谷歌研究院与耶鲁大学合作开发的Cell2Sentence-Scale 27B,可将单细胞基因表达数据转换为语言模型能够分析的类文本序列。该模型对4000多种药物进行了虚拟筛选,提出将CK2激酶抑制剂silm
Llama-Mobile 是一个面向移动设备的视觉语言模型量化框架,旨在资源受限的硬件上实现高效推理。其量化流程利用模型自身生成训练数据,无需访问原始训练环境。新的每参数 2.7 位格式支持在 Arm CPU 上高效运行。研究人员在使用 8 位激活值的情况下,将 Llama 3.2 11B Vision Instruct 压缩至 3.7GB,并在多项标准视觉问答任务中保持了较强性能。
这项研究提出了面向开放式视频流的连续编辑方法:模型在接收新的编辑指令时,持续生成并编辑后续视频片段。InfinityEdit通过一个轻量级适配器扩展流式视频生成器,该适配器包含历史交叉注意力、因果时间自注意力和编辑交叉注意力。该设计旨在保持视频的时间连续性,而不是逐帧重写源视频,并在编辑指令不断累积时维持稳定质量。适配器只在编辑指令到达的片段中启用,之后的片段由原始模型继续生成。作者报告的实验结果
AI模型聚合平台OpenRouter于8月20日发布匿名模型Ox Alpha。该模型主要面向代码编写、长时间运行的智能体任务和生产环境应用。据称,它拥有约104.8万token的上下文窗口、最高13.1万token的输出长度,并支持文本、图像和视频输入。预览期间,开发者可免费调用。开源编程智能体OpenCode也在同日接入该模型,并宣布每日最高可提供100万亿token的调用容量。在独立研究员针对
人形机器人天工 Omni 于8月22日在第二届世界人形机器人运动会小型组400米决赛中,以45.66秒夺冠。针对其跑步时像是在捂脸的特殊姿势,研发团队表示,这并非模仿某位女性或其他人类跑者。团队最初设计的是普通短跑模式,但机器人在仿真环境中通过数据持续迭代,可能自行判断“捂脸跑”比正常摆臂更舒适。天工 Omni 身高1.35米,重39公斤,未来面向狭窄空间、应急救援和家庭服务等场景。团队还开放了关
在美国,学生使用 AI 完成作业,甚至代写整篇论文的现象日益普遍。专家担心,长期依赖 AI 影响的不只是写作能力,也可能包括学生自身的思考能力。写作需要整理零散想法、选择准确词语并反复修改,因此能够训练工作记忆、规划能力和元认知。麻省理工学院一项研究还发现,使用 AI 写论文的参与者脑部活动较低,也难以回忆刚写出的内容。美国多所学校和大学正重新限制 AI 的使用,包括恢复纸笔写作、采用口试,以及限
Z.ai的唐杰和Moonshot AI的杨植麟曾是清华大学的师生,他们的职业经历表明,中国人工智能的快速发展并非突然发生。大学实验室培养了这批计算机科学家,如今他们凭借技术创新和对领先模型的借鉴,追赶Anthropic和OpenAI。报道还指出,这些研究人员非常清楚如何将研究成果商业化。
诺亦腾机器人在 2026 世界机器人大会期间发布 HiPHI,这是一套面向人形机器人学习、数字人和计算机图形学研究的高精度光学动作捕捉数据集。数据集总长 617.5 小时,包括 371.8 小时的全身人体运动数据和 245.7 小时的人与物体交互数据,并提供左右镜像版本。数据来自 132 名动捕演员,以 90 Hz 频率和亚毫米级光学精度采集,再依据 FrameNet 的人类动作语义框架,按动作单