StarHarness:通过分层搜索为企业环境演进智能体框架
StarHarness 是一个在保持模型权重不变的情况下,针对特定环境优化智能体框架的系统。它可以调整提示词、任务描述、工具接口、技能、基于 MCP 的服务提供方、子智能体结构以及智能体循环配置。该方法根据基线失败行为对任务进行分层,分离提议者可见的搜索任务与不可见的选择任务,并通过保留任务评估泛化能力。在 ITBench SRE、EnterpriseOps-Gym ITSM 和 Automati
AI 新闻中心 过去30天分析了 912 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
StarHarness 是一个在保持模型权重不变的情况下,针对特定环境优化智能体框架的系统。它可以调整提示词、任务描述、工具接口、技能、基于 MCP 的服务提供方、子智能体结构以及智能体循环配置。该方法根据基线失败行为对任务进行分层,分离提议者可见的搜索任务与不可见的选择任务,并通过保留任务评估泛化能力。在 ITBench SRE、EnterpriseOps-Gym ITSM 和 Automati
EASEL 是一项用于评估多模态智能体在闭环环境中精确使用视觉工具能力的新基准。核心任务要求智能体逐步在数字画布上作画,使结果匹配参考图像,同时测试区域标注、手写和路径规划。EASEL-Data 包含 44 万条训练样本。基于该数据训练的 EASEL-9B 相比基础模型取得 6.3% 的相对提升,在 25 个受测模型中排名第三。不过,结果表明当前多模态智能体仍存在明显不足:图像重建相似度较低,动作
中国信通院人工智能研究所发布的测试报告称,StartLux-V1.0-27B-Preview 在面向 AI 智能体的 MCP 基准测试中取得综合第二名。该模型拥有270亿参数,据称超过了参数规模更大的 DeepSeek 和 Step 模型,并在位置导航、浏览器自动化和金融分析等任务中与 DeepSeek-V4-Pro 持平或取得更好成绩。StartLux 以 Qwen3.6-27B 为基础,采用自
J-Zero 是一种无需额外训练数据、用于推动语言模型自我改进的框架。Challenger 生成难度不断增加的任务,Solver 学习给出质量更高的回答;与此同时,Judge 根据回答的生成方式,利用顺序预先确定的偏好对进行自适应。作者报告称,与基线方法相比,J-Zero 在可验证领域平均提升 4.2 分,在不可验证领域提升 8.0 分。J-Zero 至少持续迭代改进了十轮,而基线方法在两轮后出现
StepGuard是一种面向大语言模型代理的防护模型,既能审计已完成的代理执行轨迹,也能在工具操作执行前检查潜在风险。研究团队使用StepGen自动生成安全和不安全的轨迹:两者拥有相同上下文,但在风险步骤采取不同操作。为减少过度防御和防御不足,研究人员还提出了Balance-GRPO,根据观测到的准确率动态平衡安全与不安全操作的学习。实验显示,StepGuard在开放权重防护模型中取得最高平均准确
ABot-Recon 是一种从超长视频中进行三维场景重建的流式模型。它不维护庞大的长期记忆,而只缓存前 11 帧的键值特征。模型在当前相机坐标系中预测点图,并估计相邻帧之间的相对位姿,再通过序列组合恢复全局相机位姿和场景几何。轻量级时间细化器用于减少旋转漂移,考虑组合过程的位姿损失则用于训练多步位姿组合。在 Oxford Spires 基准测试中,ABot-Recon 的绝对轨迹误差为 4.35
LMSM 将 Linux Security Modules 的设计应用于大语言模型服务。该框架将经过校准的安全证据、版本化策略评估,以及缓冲输出的发布授权彼此分离。原型系统可在 Hugging Face Transformers 和 vLLM 中支持稀疏自编码器、转换器和密集探针。在 Qwen3-4B 上,LMSM-Checkpoint 将 HarmBench 攻击成功率从 39.20% 降至 3
该研究提出了 VLAct,一种面向视觉语言动作(VLA)系统的视觉语言模型骨干。VLAct 使用来自多种机器人形态的异构机器人数据进行持续预训练,在保留视觉语言模型通用知识的同时,促进跨机器人形态的共享动作语义。在固定机器人数据量和微调预算下,VLAct 在仿真、真实环境任务以及向未见机器人形态迁移时均提升了性能。它在 LIBERO-Plus 和 RoboTwin 2.0 上分别取得 82.6%
该研究提出了 Rubric-to-Code Credit Assignment(RCCA),一种面向强化学习的框架,用于让模型根据自然语言需求生成可用的 HTML、CSS 和 JavaScript 应用。RCCA 不再将单一的序列级奖励平均应用于所有 token,而是把功能反馈对应到相关代码区域和生成 token。其分层奖励机制区分格式、源代码、运行时和功能错误。Ling-RCCA-Flash 在
GeoNeXt重新利用预训练视频生成模型,从单张图像中联合估计深度和表面法线。该方法将几何估计定义为下一帧预测任务,从而利用视频模型中结构化的视觉先验,并以远少于以往方法的标注数据学习图像与几何信息之间的关系。在多个数据集上的实验表明,GeoNeXt在零样本单目深度和表面法线估计方面优于以往的任务专用型和统一型生成方法。它的性能还接近使用超过百倍数据训练的判别式先进方法,并在多个基准测试中超过这些
PonderPounce 将多模态大语言模型(MLLM)的原生因果上下文用作机器人控制的情景记忆。系统结合了 Ponder 和 Pounce:前者是较慢的 System 2 MLLM,负责积累观测、示范和此前的推理;后者是快速的视觉—语言—动作模型,直接根据当前观测生成动作。两者端到端联合训练,无需专用记忆模块或单独的桥接预训练。经过服务优化后,系统支持 20Hz 的动作执行。在 RoboMME
该研究提出“Code-as-World”,将物理世界表示为可执行代码。代码以紧凑、可控且具有定量依据的方式描述物体构成、动态变化和视觉外观。系统通过一个智能体循环,依据自然语言描述或现实世界视频等多模态观测,提出、执行、渲染、验证并反复改进世界假设。经过验证的可执行世界表征可作为可扩展的监督信号,用于训练视觉语言模型进行定量物理推理。研究人员表示,Code-as-World-VL在QuantiPh
ContextPilot 是一个面向长期智能体任务的主动式上下文管理框架。它在现有工具基础上加入规划、长期记忆和灵活的上下文卸载功能,并提出专用强化学习方法,用于识别关键编辑决策,更准确地评估各项操作对最终结果的贡献。在长上下文问答和深度搜索实验中,ContextPilot 在使用更紧凑工作上下文的同时,在多种基础模型和基准测试上持续优于现有方法。代码已公开。
研究人员推出 ElephantBench,这是一套可复现的基准测试,用于评估大语言模型是否保留罕见事实的不同说法。数据集包含1,094个问题,通过可审计的图谱式流程,从存在自然分歧的网络文档中生成。所有答案都与原始文档及权威公开来源进行核验,并由人工标注员审查。在测试的32个模型中,即使表现最好的模型,也只在52.4%的问题上同时找回两种说法。在其余大多数情况下,模型只记住一种说法而遗漏另一种。扩
北京邮电大学表示,由该校牵头建设的太空算力云已开始常态化提供在轨试验服务。平台连接卫星、太空服务器、地面站和地面数据中心,实现任务编排、算力调度、数据计算与结果回传的自动化。系统包含统一 SDK 和开发环境、针对太空环境轻量化适配的云原生软件运行栈,以及多颗卫星载荷之间的动态协同调度能力。校方称,该平台已为超过 100 家用户完成数百次算力调用,应用于在轨大数据处理、6G 通信、分布式存储和 AI