OmniVBench:面向参考生成视频的大规模基准与数据集
OmniVBench是用于评估多种参考控制视频生成模型的基准,涵盖内容、动作、风格、结构、叙事和多参考等7类任务、18项细分任务。其包含12,172个针对具体案例的检查项,用于评估参考因素是否被准确保留、解耦、绑定到正确目标,并按照指令实现。配套的Omni-R2V数据集包含34万个经过处理的训练样本,主要来自专业视频素材。对开源和闭源模型的评估显示,不同任务类别和评估维度之间仍存在明显性能差距。
AI 新闻中心 过去30天分析了 317 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OmniVBench是用于评估多种参考控制视频生成模型的基准,涵盖内容、动作、风格、结构、叙事和多参考等7类任务、18项细分任务。其包含12,172个针对具体案例的检查项,用于评估参考因素是否被准确保留、解耦、绑定到正确目标,并按照指令实现。配套的Omni-R2V数据集包含34万个经过处理的训练样本,主要来自专业视频素材。对开源和闭源模型的评估显示,不同任务类别和评估维度之间仍存在明显性能差距。
RecreationWorld是一套面向混合计算机使用代理的研究与评测框架,支持代理结合图形界面操作、软件开发和命令行工具。在Ubuntu、macOS、Windows、Android和Web环境中,代理需要研究正在运行的参考应用,并在没有预设流程的情况下构建忠实实现。统一测试系统同时评估程序结果和视觉结果。配套的RecreationBench包含跨领域、跨平台的250项任务。GPT-6 Astra
GraphSkillEvo是一种优化大语言模型智能体技能的方法。它不再将技能表示为缺乏结构的自然语言指令,而是将其建模为有向图:节点包含执行步骤和操作指导,边表示依赖上下文的步骤转换。该方法采用基于种群的进化过程,通过变异和交叉同时探索多个候选技能。在五项智能体基准测试中,作者报告称,与SkillOpt相比,GraphSkillEvo在GPT-5.4-nano上的平均准确率提高了4.01个百分点,
针对社区反馈的产品安全问题,ZCode 团队已在 GitHub 开源代码,并邀请中国信息通信研究院和绿盟科技开展安全审计。团队表示从未留存用户代码或数据,也未将其用于模型训练。客户端 v3.14.0 已移除 Repo Wiki 功能,并切断本地仓库快照的生成与上传链路。绿盟科技审查后确认,未发现可触发快照生成或文件外发的功能路径。技术评测还确认,阿里云 OSS 的 zcode-prod 存储桶已无
阿里巴巴发布了用于图像生成的 Qwen-Image-2.1,这是一款拥有70亿参数的开放权重模型。该公司称其性能超过大多数闭源模型。模型原生支持透明度处理,并可使用最多10张参考图像。相关性能说法来自阿里巴巴,仍需通过独立基准测试进行验证。
阿里巴巴已开源图像模型 Qwen-Image-2.1,将文生图与图像编辑整合在同一系统中。其视觉生成部分仅有 70 亿参数,并原生支持透明图像的生成与编辑。用户最多可提供 10 张参考图,用于局部编辑、人像和商品图像等任务。阿里巴巴还表示,模型改进了文字排版、人物光影和细节表现。Qwen-Image-2.1 已通过 GitHub、Hugging Face 和 ModelScope 提供。
微信 AI 团队已将知识管理框架 WeKnora 开源,0.8.0 版本以 MIT 许可证面向公众提供。该项目旨在让知识库不只负责查找答案,还能执行任务。anydoc 支持直接导入 PDF、Word、Markdown 和网页等格式,Wiki 模式则可将非结构化文档整理为结构化知识。GraphRAG 会抽取实体及其关系,构建知识图谱,在处理事物之间关联的问题时,补充单纯向量检索的不足。Skill S
在2026世界制造业大会开幕式上,工业和信息化部副部长辛国斌表示,中国将把新一代智能制造作为重点方向。工信部将提升产业创新能力,推动传统产业转型升级,扩大先进制造业集群,并深入推进人工智能与制造业融合。同时,工信部将大力发展开源基座模型和垂类模型,梯度培育智能工厂,夯实智能制造所需的软硬件基础,并推动制造业绿色低碳转型。
阶跃全面开放了面向 Agent 任务的新一代开源旗舰模型 Step5Preview。该模型采用稀疏 MoE 架构,总参数量为 6000 亿,但每次推理仅激活 270 亿,支持 100 万 Token 上下文窗口以及文本和视觉输入。阶跃称,Step5Preview 在 Artificial Analysis 的 Intelligence Index 中获得 44 分,进入全球开源模型前三。在 Age
阿里巴巴达摩院已开源医疗视觉语言模型 RADAR,用于分析 CT 扫描图像。达摩院称,该模型能够识别约150种腹部疾病,包括癌症。发表在《Science》上的一项新研究使用近4万份真实世界检查数据对其进行了测试,并称 RADAR 的表现超过了大多数放射科医生。不过,在临床应用前仍需经过独立验证和监管审批。
阶跃星辰(StepFun)宣布推出旗舰模型 Step 5 Preview,主打 AI 编程、软件工程及智能体(Agentic)任务。该模型采用稀疏混合专家(MoE)架构,总参数量达 6000 亿(激活参数 27 亿),支持 100 万 Token 上下文窗口与原生多模态输入。在 Artificial Analysis 综合智能指数中,该模型位列全球开源模型前三。官方表示,其单任务成本仅为 Clau
阶跃星辰发布基座模型Step5Preview,主要面向AI编程、软件工程、专业知识工作和金融等场景。公司称,该模型在Artificial Analysis Intelligence Index的开源模型中位列全球前三,单任务成本仅为Claude Opus 5的八分之一。Step5Preview采用稀疏MoE架构,总参数量6000亿,激活参数270亿,支持最长100万Token上下文,并原生支持文本
中国电信发布了 Xing4.0-29B-A4B。这款混合专家模型总参数量为290亿,每次推理激活约40亿参数,原生支持25.6万 token上下文,并可扩展至51.2万 token。公司称,该模型从使用昇腾芯片训练,到框架适配和推理部署,均采用国产硬件与软件。在其公布的 SuperCLUE 评测中,模型的智能体能力获得93.52分,排名第三。经过4-bit量化后,显存占用据称约为15GB,可在 R
开源 AI 编程工作台 Termexo 发布 v0.10.4,新增对 Grok Build 的支持。用户安装并登录 Grok Build CLI 后,Termexo 可以自动识别它,在工作区启动终端,列出和恢复历史会话,并通过任务看板执行任务。Grok Build 现在可与 Claude Code、Codex、OpenCode 和 Antigravity 一起由同一界面管理。该版本还修复了长时间运
在上海举行的生物医药论坛上,专家指出,AI辅助药物研发的主要瓶颈并不只是模型规模,而是高质量数据以及数据持续回流的能力。L.E.K. Consulting统计显示,截至2025年,全球已有超过100个AI辅助药物分子进入临床阶段,超过90家中国企业与AI生物科技公司建立合作。但行业仍缺乏高质量的分子结构数据和机制性数据。模型面对从未学习过的新分子时,预测性能可能下降;目前可获得的数据也多为单模态,