AVA-Encoder:面向智能体原生视频表征学习
AVA-Encoder 是一个研究框架,可将视频转换为包含结构化文本的知识图谱,并关联图像、音频和视频资产,随后再将其重建为视频。该方法旨在帮助 AI 智能体理解、查询和编辑电影级内容。系统利用视频重建差异生成的自然语言反馈来优化编码策略,并可在测试阶段进一步细化知识图谱表征。实验显示,AVA-Encoder 比最强外部基线提升了 20.7 个百分点。在受控策略设置中,经过伪训练的镜头级智能体视频
AI 新闻中心 过去30天分析了 2005 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
AVA-Encoder 是一个研究框架,可将视频转换为包含结构化文本的知识图谱,并关联图像、音频和视频资产,随后再将其重建为视频。该方法旨在帮助 AI 智能体理解、查询和编辑电影级内容。系统利用视频重建差异生成的自然语言反馈来优化编码策略,并可在测试阶段进一步细化知识图谱表征。实验显示,AVA-Encoder 比最强外部基线提升了 20.7 个百分点。在受控策略设置中,经过伪训练的镜头级智能体视频
该研究提出 MBA-Bench,这是一个用于训练和评估商业创意生成智能体的多模态基准。数据集包含来自六个领域的3万条样本,每个领域都包含仅靠文本难以完整表达的视觉信息。研究人员结合图像描述、GPT-4o、检索查询生成、市场证据检索和基于证据的合成来生成参考创意。MBA-b和MBA-k两个智能体分别面向隐藏和公开评估标准进行训练,采用基于LoRA的监督微调以及结合创造力、可行性等奖励的群组相对策略优
研究人员提出了一套用于去除玻璃拍摄视频中反射的框架。S2R-Synthesis管线通过模拟玻璃粗糙度造成的模糊、厚度引起的重影以及反射率变化等物理效应,生成有反射和无反射的视频配对数据。在此基础上,S2R-Removal利用预训练视频扩散模型进行适配,在一次去噪步骤中恢复干净的透射画面。研究还构建了S2R-Bench,这是一个面向视频反射去除的基准,支持全参考评估和真实场景下的人工感知评估。实验结
StateFlow是一种面向电影、游戏、建筑和城市设计的人工智能预可视化研究框架。它不在每次修改时重新生成完整场景或视频,而是维护一个持久、可编辑的三维世界状态,其中包含场景元素、几何结构、外观以及摄像机配置。系统通过三个阶段构建、演化并访问这一状态:将生成的二维内容提升为一致的三维世界,把用户意图转化为保留世界记忆的结构化状态变化,并利用渲染反馈优化摄像机运动轨迹。在需要更高视觉保真度时,还可以
AI云服务商CoreWeave已签署合同,将英伟达A100 GPU出租至2029年。A100于2020年推出,这意味着客户在芯片上市约9年后仍愿意租用它来运行AI工作负载。该交易为反驳“旧款AI GPU会在两三年内因新一代芯片推出而失去经济价值”的观点提供了证据。CoreWeave还表示,其老一代英伟达GPU资源基本已经售罄。最新模型完成训练后,这些GPU仍可转用于推理和其他要求较低的计算任务。业
《Clinical Imaging》发表的一项调查显示,对乳腺影像学会215名成员的调查发现,乳腺癌检测AI工具在临床实践中的实际效果低于放射科医生预期。约半数受访医生已经使用FDA批准的系统,另有11%计划引入,但多数仅将AI视为辅助性的“第二诊疗意见”,很少有人把它作为决定性因素。仅35%的医生观察到召回率下降,低于59%的预期;仅9%发现不必要的活检减少,远低于36%的预期。感到职业倦怠减轻
中国大模型企业北京月之暗面科技近日完成最新工商信息变更。该公司注册资本已由152.36万元增至223.85万元。月之暗面成立于2023年,业务涵盖人工智能基础软件和人工智能应用软件开发。此次资本调整可能与业务扩张有关,但不代表一轮大规模融资或重大技术突破。
亚马逊宣布,OpenAI 的 Daybreak Red 和 Daybreak Blue 两款网络安全模型已面向符合条件的 Amazon Bedrock 客户开放。两款模型被称为 OpenAI 网络防御计划 Daybreak 的组成部分。Daybreak Red 据称可提供 GPT-5.6Cyber 的访问权限;Daybreak Blue 则包含 GPT-5.6Sol 等通用模型,并针对防御性网络安
据知情人士透露,Anthropic PBC正洽谈以约60亿美元收购人工智能初创公司Decart AI。目前尚未确认双方达成交易。
作者认为,仅通过 RLHF、DPO 或 Constitutional AI 在训练阶段植入安全性,对于能够执行代码、修改文件、发送消息和变更数据库的自主智能体而言并不充分。他们提出由智能体运行框架强制执行的运行时契约,将沙箱、权限控制、输出过滤和轨迹监控等预防措施,与要求测试结果、日志、文件差异和有依据引用等可验证证据的核验机制结合起来。研究参考了对 52 起 AI 智能体和大语言模型安全事件、3
Spark-to-Paper是一套端到端研究论文生成系统,以13项可组合技能集成在现有编程助手中。系统能够检索文献、规划并执行实验、生成可编辑图表,并依据测量结果修改论文论断。它结合确定性的完整性检查与自我批评,用于检测捏造内容,并限制实验不断否定原始研究目标的失败循环。在8个受控研究主题中,系统取得99.5%的引文有效率和96.4%的图表可编辑率。消融实验显示,完整的完整性与审查机制可将捏造检测
与外部工具集成的大语言模型智能体容易受到嵌入环境状态中的间接提示注入攻击。ToolHazard是一种可扩展的对抗环境合成框架,旨在减少人工工程工作。它结合环境模拟器、攻击者智能体和用户模拟器,生成可执行的有状态环境,发现可行的注入点,生成针对具体环境的攻击载荷,并构建基于环境状态的长程任务。研究人员基于该框架建立了ToolHazard-Bench,用于在复杂工作流和多种环境攻击下进行压力测试。实验
小米宣布澎湃 OS 4 Beta 版上线,并决定不举办传统发布会,而是通过专门团队收集用户反馈并持续优化系统。此次更新包括升级自研 Xiaomi HyperCore,引入负载精算和内存预载技术,以改善响应速度和操作流畅度。小米还推出接入自研 MiMo 模型的“超级小爱 2.0”,提升跨应用、跨设备的任务编排与内容生成能力。首批 Beta 版适配机型已于 8 月 13 日上午 11 点在小米社区开启
路透社的一项调查显示,超过 80% 的日本企业仅有限度地使用 AI,或完全没有使用。约 60% 的受访企业表示,AI 只应用于部分部门或有限任务;18% 尚未决定是否在工作场所引入 AI,6% 则尚未考虑使用。只有 16% 的企业已将 AI 视为不可或缺的工具。受访者提到,缺乏相关专业能力以及不清楚实际应用方式,是采用 AI 的主要障碍。日本政府报告还显示,日本在生成式 AI 应用方面落后于中国、
德国非营利组织HateAid已对Meta、Ray-Ban、Oakley及多家零售商提起刑事投诉。该组织认为,配备摄像头的智能眼镜能够进行隐蔽录制,可能违反德国隐私保护法律。HateAid还要求限制智能眼镜可进行录制的场所,类似于对行车记录仪和执法人员随身摄像机的相关规定。Meta表示,产品从设计阶段就已加入隐私保护措施,包括录制时闪烁的LED指示灯,以及检测到指示灯遭遮挡或篡改时停用摄像头的机制。