OpenRouter 发布 2026 嵌入模型选型指南
OpenRouter 核查了目录中的 37 个嵌入模型条目,并通过 28 项 API 检查测试了 19 个模型。指南建议英文 RAG 以低成本的 text-embedding-3-small 起步,长上下文场景选择 Voyage4-large,多语言开放权重方案则考虑 Qwen3-Embedding-8B。代码搜索可使用 voyage-code-4,文本与图像检索可选择 Gemini Embedd
AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenRouter 核查了目录中的 37 个嵌入模型条目,并通过 28 项 API 检查测试了 19 个模型。指南建议英文 RAG 以低成本的 text-embedding-3-small 起步,长上下文场景选择 Voyage4-large,多语言开放权重方案则考虑 Qwen3-Embedding-8B。代码搜索可使用 voyage-code-4,文本与图像检索可选择 Gemini Embedd
Meta超级智能实验室产品负责人Nat Friedman表示,AI代理产品Muse在产品设计上确实深受OpenClaw影响,但强调Muse本身是从零开发的。此前,一篇广泛传播的帖子称Muse几乎就是面向普通用户的OpenClaw。社区发现,两者都包含几乎相同的SOUL.md文件,用于定义AI代理的个性、沟通风格、价值观和行为边界。Friedman没有否认这些相似之处,并称赞OpenClaw创始人P
Alphabet旗下机器人软件公司Intrinsic已根据Apache 2.0许可证开源Intrinsic Core。该项目为开发者构建物理人工智能和机器人系统提供基础软件组件。此次发布可能有助于简化智能机器人应用的开发与集成,但目前尚无证据表明其已获得广泛采用,或已经带来重大的产业变革。
Cisco Talos 发布了 CAIRN,这是一款用于分类和分析使用 AI 聊天机器人的恶意软件及黑客工具的开源框架。该系统通过追踪 AI 相关元数据和行为特征,帮助识别这类威胁。Talos 研究人员在调查过程中还发现,这类新兴恶意软件存在一些异常特征。
该研究提出了 Complex KDA(CKDA),这是面向高效线性循环神经网络的 Kimi Delta Attention 扩展。通过将基于 delta rule 的变换与按通道的反射门控结合,CKDA 在保留对角加秩一、非扩张转移结构的同时,可以表示二维旋转。研究人员证明,CKDA 能够精确表示所有具有这一结构的正交矩阵。实验显示,在状态跟踪和周期性音频延续任务中,CKDA 在测试的 KDA 设
Jev(又称“System One”)被介绍为一种不生成文字、只输出判断所需概率值的模型。文章称,开发者已将它用于 Home Assistant 提醒、上下文筛选、手机自动化、数据清洗、数据库处理和游戏。其标称成本远低于大型生成式模型,发布数日内据称便出现近五百个开源项目。这种方法可能将简单的分类与判断任务,从高成本的文本生成中分离出来。不过,文章中关于性能、采用规模和成本的数据尚未得到独立验证。
论文提出了SVEET,一个通过适配预训练双向视频扩散模型实现高质量流式视频编辑的框架。该方法基于骨干特征解耦和条件帧独立性,支持自回归式编辑。辅助模型分支使用时间独立的自注意力编码源视频,并将中间特征注入骨干网络的对应模块。此外,解耦训练方案将视频可控性与模型因果性的优化目标分开,从而支持在不同骨干架构之间进行零样本迁移。实验显示,SVEET无需额外加速技术,即可在单张H100 GPU上达到每秒1
研究人员提出了 CARE(Corrective Atomic Robotic Execution)框架,旨在提升机器人“视觉-语言-动作”(VLA)策略的可靠性。现有的 VLA 策略在偏离标准轨迹时容易失效。CARE 通过学习执行过程中的失败经验,建模失败后的偏差分布,并合成具有代表性的失败状态与校正示范。在推理阶段,CARE 结合阶段式规划与物理 3D 监控,在保留任务进度的同时触发动态微调或重
OmniEdu 是一系列面向 K-12 学习与教学的开放基础模型。其指令微调语料包含 69,999 个样本,围绕四项能力构建:学科能力、课程结构理解、学习困难诊断推理,以及教学支持与脚手架。研究团队微调了 4B、9B 和 27B 模型,并评估其课程理解、K-12 解题、教学辅导和通用能力。OmniEdu-27B 在 K12-Bench 上取得 63.12% 的 Exact Match 和 76.6
该研究分析了稀疏策略内蒸馏,即只对学生模型生成轨迹中的少量令牌提供教师模型监督。作者提出信息效率比(IER),同时衡量令牌的有用性和梯度估计的可靠性。通过候选集近似,可以在保留采样反向 KL 训练目标的同时选择令牌。在数学和医学推理任务中,加入 IER 后,现有令牌选择方法在多种设置下得到改进。当令牌预算为 0.1% 至 1% 时,稀疏训练在部分情况下达到了或超过未进行令牌选择的完整策略内蒸馏。代
onPanda是一款用于高效标注大语言模型和智能体对齐数据的交互式工具。标注者在模型回答中找到第一个不恰当的令牌,从模型候选项中选择替代内容或直接输入正确文本,然后从修正后的前缀继续生成。一项小规模对照研究显示,与手动事后编辑相比,该方法可将标注时间中位数缩短52%。由于最终回答中的大多数令牌仍由模型生成,所得数据在很大程度上保留模型的采样分布,适合构建在线策略监督微调和偏好数据。记录的纠正还提供
小米发布开源 MiMo-V2.6 系列,包含多模态模型 Pro 和 Flash。据小米介绍,MiMo-V2.6-Pro 在金属有机框架(MOF)材料研究中协助检索文献、提出候选方案并分析模拟结果,探索用于吸附 PFAS 的材料设计;研发周期据称从约一个月缩短至两三天。北京大学研究员窦锦虎评价其达到训练有素的博士研究人员水平。小米还称,该模型协助使用 Lean 4 完成了 Li–Yorke 经典论文
估值156亿美元的法律AI独角兽Harvey,据报正因模型调用和API成本飙升而降低对OpenAI与Anthropic的依赖。AI智能体更新后,客户使用量大幅增长,但其毛利率据称从年初约50%降至6月的-50%。随后,Harvey推出了基于中国月之暗面Kimi K3的自研模型,并重构推理架构。公司表示,这些调整已使毛利率恢复为正。Abridge、Decagon、Ramp和Rogo等企业也在开发自有
RRSI是一种自动改进基于大语言模型的智能体系统的方法,涵盖提示词、控制流程、工具、记忆和上下文管理。该方法旨在缓解过拟合问题,即系统在用于优化的任务上取得明显提升,却难以迁移到未见过的基准测试。RRSI限制每个候选方案可合并的修改数量,鼓励探索尚未尝试的改进路径,并通过批评器和剪枝器过滤特定于基准、成本过高或已失去作用的修改。在涵盖编程、智能体工作空间和工程设计的八项基准测试中,RRSI在优化数
上海人工智能实验室与上海交通大学LUMIA Lab提出了下一概念预测(Next Concept Prediction,NCP),试图替代传统的逐词元预测预训练方式。其89亿参数模型NCP-ArchPreview使用Dolma-3语料库中的5.73万亿个词元训练。技术报告称,该模型仅使用51.3%的词元预算,就达到了OLMo-3-7B最终预训练损失水平,等效收敛速度提升1.95倍。团队还报告了下游任