网络防御窗口收窄之际,Daybreak扩大服务
OpenAI推出专注于网络安全的GPT-5.6-Cyber,可通过Daybreak Red用于经授权的漏洞研究、漏洞利用验证和安全测试。公告没有提供独立的性能数据,也未证明该模型已广泛开放使用。
AI 新闻中心 过去一年分析了 1723 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI推出专注于网络安全的GPT-5.6-Cyber,可通过Daybreak Red用于经授权的漏洞研究、漏洞利用验证和安全测试。公告没有提供独立的性能数据,也未证明该模型已广泛开放使用。
OpenAI正向经过审核的网络安全合作伙伴提供GPT-5.6-Cyber。这是GPT-5.6 Sol的一个更宽松版本,面向防御性安全工作。该公司还在扩大Daybreak计划,帮助企业应对日益自主化的网络攻击。报道没有提供独立的技术基准测试结果。
OpenAI宣布推出两档Daybreak服务。Daybreak Blue提供前沿模型的访问权限,Daybreak Red则提供针对网络安全任务专门训练的模型。该服务包括最新的网络安全专用模型GPT-5.6-Cyber。公告尚未公布详细的性能基准、价格或供应信息。
一项研究分析了为何使用OpenHands轨迹数据微调的CLI软件工程代理,在其他脚手架上部署时性能会显著下降。研究人员认为,这种差距源于脚手架特有的规划行为,并区分了执行前生成的显式计划,以及贯穿代理循环的隐式结构惯例。DCAS是一种拦截层,可在不修改脚手架的情况下连接任意CLI脚手架与后端模型。实验表明,使用包含规划信息的轨迹进行微调,能够提升模型在非训练脚手架上的表现,说明规划能力可以从脚手架
研究人员推出 FaceVid-Forensics-100K,这是一个包含 10 万个深度伪造视频的数据集,覆盖 33 种合成方法,并提供细粒度文本标注。其 ARGUS 框架由四个专门智能体分别分析纹理、光照、运动和物理特征,再由裁决智能体整合结果并生成带解释的判断。研究人员称,该系统完全由小型开源多模态语言模型构成,在域外测试中超过了包括 GPT 和 Gemini 闭源模型在内的所有对比方法,并在
经批准的 Daybreak 合作伙伴可以使用 OpenAI 的前沿网络安全模型,在授权和治理机制下为客户提供网络安全服务。
Meta推出的新型开放权重模型Muse Glimmer,被称为一窥马克·扎克伯格个人超级智能愿景的窗口。这一消息也凸显出日益扩大的差距:用户可以自行拥有一些AI模型,而另一些系统只能通过外部服务访问。不过,现有描述没有提供具体性能基准,也没有独立证据证明该模型实现了重大的技术突破。
据路透社报道,Meta 首席执行官马克·扎克伯格呼吁美国政府减少对开源或开放权重 AI 模型的限制,以便与中国竞争。他表示,AI 应该广泛普及,而不应由少数机构掌控。报道还提到,Meta 据称推出了采用 4bit 量化技术的 AI 模型 Muse Glimmer,可在配备 24GB 或 32GB 显存的 Mac 和 PC 上本地运行。随着 AI 开发成本上升,以及 Anthropic 和 Open
总部位于特拉维夫和旧金山的 Corma 专注于开发防御型网络安全人工智能模型。公司在 Sequoia Capital 领投的 6000 万美元种子轮融资后结束隐身状态。Corma 旨在应对功能强大且易于获取的人工智能模型日益普及所带来的网络安全风险。
据彭博社报道,Meta发布了一款精简版人工智能模型,消费者可以下载并在个人电脑上使用。该程序名为Muse Glimmer。目前的报道没有提供更多技术细节或性能基准。
Model ML 使用 GPT-5.6 Sol 处理金融工作,涵盖研究、分析,以及制作可编辑且可追溯的 PowerPoint 演示文稿和 Excel 工作簿。目前没有提供具体的性能数据或独立对比结果。
Meta 的新模型将全天候运行的 AI 智能体置于核心位置。这一简短声明暗示 AI 将更深入地融入日常使用,但没有提供技术性能数据或具体产品细节。
一项研究发现,当系统独立评估并选择词元、句子或文本块时,硬提示压缩可能破坏关键的指涉关系。如果答案被保留,但用于理解答案的实体被删除,就会产生“指涉悬空”。在0.30的压缩率下,多个基准测试中最多有60%的案例出现这一问题。重新插入缺失的支持段落后,准确率提高了29至34个百分点。一个用于自动判断被删除句子是否必要的小型分类器,在压缩率几乎不变的情况下,使HotpotQA准确率提升4.7个百分点。
苹果曾在中国支持网站短暂发布一份中文指南,说明 Mac 用户如何将阿里巴巴的通义千问连接到 Siri 和写作工具。根据指南,在 macOS 26.6 或更高版本上,Siri 可借助通义千问提供更详细的回答并分析照片和文档,写作工具则可生成文字和图像。用户需要登录自己的通义千问账户,且阿里巴巴不得使用提交的内容训练或改进模型。苹果在不到一天后删除了这份指南。此次撤下可能与技术调整或尚未完成的监管流程
研究人员使用 Psych-101 训练了14个模型,参数规模从1.35亿到140亿不等。Psych-101包含来自160项实验的1,070万条试次级选择数据。在与训练数据相同的分布内,模型规模影响很小:6亿至10亿参数的模型在未参与训练的受试者上,达到了700亿参数基准模型的相近表现。但在泛化到新任务结构时,更大的模型明显更具优势。诊断测试显示,屏蔽刺激和反馈内容会破坏75.7%的已学习信息,并使