OpenRouter 发布 2026 嵌入模型选型指南
OpenRouter 核查了目录中的 37 个嵌入模型条目,并通过 28 项 API 检查测试了 19 个模型。指南建议英文 RAG 以低成本的 text-embedding-3-small 起步,长上下文场景选择 Voyage4-large,多语言开放权重方案则考虑 Qwen3-Embedding-8B。代码搜索可使用 voyage-code-4,文本与图像检索可选择 Gemini Embedd
AI 新闻中心 过去一年分析了 1723 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenRouter 核查了目录中的 37 个嵌入模型条目,并通过 28 项 API 检查测试了 19 个模型。指南建议英文 RAG 以低成本的 text-embedding-3-small 起步,长上下文场景选择 Voyage4-large,多语言开放权重方案则考虑 Qwen3-Embedding-8B。代码搜索可使用 voyage-code-4,文本与图像检索可选择 Gemini Embedd
火山引擎已为Seedance 2.5 API推出Draft模式。创作者可先以较低成本生成480P样片,检查场景、构图、主体动作、对白、音效和运镜节奏,再通过样片ID生成1080P成片。系统会延续提示词、参考素材以及seed、画面比例、时长等关键参数。官方以5秒1080P视频为例称,抽卡4次时成本可降低57%,抽卡20次时节省幅度可达77%。与先生成低分辨率视频再进行超分辨率处理不同,该模式直接生成
该报告介绍了 Ovis-Embedding,这是一系列全模态嵌入模型,利用统一的多模态骨干网络,将文本、图像、视频和音频编码到共同的表示空间中。该方法以预训练的 Qwen-Omni 模型为基础,结合对比学习、覆盖多种模态的高质量数据集,以及聚焦损失和基于相似度的嵌入蒸馏等专用技术。低秩特征分解能够在性能损失有限的情况下生成维度灵活的紧凑嵌入。报告中的评测显示,Ovis-Embedding 在 MM
AIDE^2 是一个能够修改 AI 研究智能体自身代码的系统。它在研发任务上评估修改后的版本,并保留表现最佳的改动。在一次持续 8 天的自主运行中,系统发现了 7 项连续改进,包括新的搜索策略,以及压缩和管理不断增长的上下文的机制。这些改进还迁移到了 4 个未参与筛选的基准测试,涵盖机器学习工程、启发式算法工程和基于物理的天气预报。最强版本的表现达到或超过了一款由人类设计、实力较强的生产级研究智能
Flash-dLLM是一种无需训练的推理加速框架,旨在提升扩散式大语言模型(dLLM)的运行效率。研究发现,在启用KV缓存的dLLM推理中,GPU内存I/O是主要瓶颈,因此提出I/O感知的融合式KV缓存内核,以减少冗余的数据搬运。该方法还采用由KV缓存驱动的草稿生成与验证策略,由同一个dLLM同时充当草稿模型和验证器,无需额外辅助模型。在数学推理和代码生成基准测试中,Flash-dLLM在推理速度
据媒体报道,字节跳动旗下豆包通用 Session 团队预计缩减约一半。该团队此前约有 50 人,主要负责豆包聊天产品的产品策略、评测等工作。调整后,部分员工将转岗至豆包商业化、飞书等团队,其余人员可能被裁撤。负责基于 Seed 基础模型开展豆包对话模型后训练的 Product Posttrain-Chat 团队,也因相关业务需求减少而缩编。此次调整同时涉及产品团队和模型后训练环节,显示字节跳动正将
本期科技资讯包含多项人工智能相关发布。OpenAI推出GPT-6 Sol和Luna,称两款模型采用类似GPT-6 Astra的训练方法,运行速度更快、成本更低,API价格将下调50%。高通发布第六代骁龙8移动平台,面向旗舰手机,官方宣称CPU频率超过5GHz、GPU性能提升44%。阿里巴巴平头哥发布真武V900 AI芯片,声称算力达到真武M890的3倍,并支持FP8和FP4精度。小米预告18 Pr
前沿AI模型的竞争已进入比较价格与性能的阶段。Anthropic和OpenAI都强调,最新模型能够以更低成本提供更强的能力。
Parallel表示,其AI代理使用GPT-6 Astra研究并综合劳动力市场数据,所需时间和成本均降至此前模型的一半。该说法来自公司自身,目前没有独立验证或测试方法的详细信息。
高通在2026年骁龙峰会上宣布,与阶跃、无量火及江波龙合作,基于第六代骁龙8超级至尊版移动平台,对StepEdge-Omni 30B-MoE模型进行端侧适配和推理优化。该混合专家模型仅根据任务需要激活部分专家模块,以降低计算量和内存带宽需求。合作方表示,通过优化推理引擎、异构调度和存储方案,模型运行内存需求较传统方案降低超过50%。模型无需调用云端,即可在手机上完成邮件理解、行程规划、日历同步、航
据称,GPT-6 Sol 与 Luna 已于周二发布,且不易出现错误。不过,这一说法尚未得到证实,现有信息也没有提供具体价格或可信的基准测试结果。
一项新研究分析了在大语言模型的完整强化学习流程中使用 FP8 所导致的不稳定问题。研究人员发现,累积的 FP8 量化噪声会扭曲重要性比率,并错误地将负优势 Token 的梯度归零,从而引发训练中途熵异常激增和输出乱码,使异常结果不断累积。为解决这一问题,研究提出“Calibrated Clipping”,通过动态调整 FP8 的裁剪范围,使其与高精度 BF16 分布保持一致。在 GRPO、DAPO
高通推出两款强调人工智能处理能力的新款智能手机芯片。该公司表示,性能更高的芯片可以在设备本地运行一个拥有300亿参数的混合专家模型。目前尚未公布独立性能数据,也未透露具体支持的模型。
GPT-6 通过提高缓存命中率、增加新的诊断工具、支持显式断点和提供更多控制选项,改进了提示词缓存。这些变化旨在降低模型使用过程中的延迟和成本。
Meta高管Nat Friedman表示,Muse虽然是“从零开始”开发的,但受到OpenClaw“很大程度的启发”。早期用户正在比较这两款AI产品,有人甚至称Muse是“给普通人的OpenClaw”。目前,这些比较主要基于用户的观察和猜测。