Transfyr完成2500万美元种子轮融资,利用AI应对科学研究可重复性危机
总部位于马萨诸塞州剑桥的初创公司Transfyr在完成2500万美元种子轮融资后结束隐身运营。该公司使用传感器和软件记录实验室工作的实际过程,再训练AI模型识别其中的模式,并捕捉通常不会被记录的实验室隐性知识。公司希望借此帮助应对科学研究中的可重复性危机。
AI 新闻中心 过去30天分析了 911 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
总部位于马萨诸塞州剑桥的初创公司Transfyr在完成2500万美元种子轮融资后结束隐身运营。该公司使用传感器和软件记录实验室工作的实际过程,再训练AI模型识别其中的模式,并捕捉通常不会被记录的实验室隐性知识。公司希望借此帮助应对科学研究中的可重复性危机。
SWE Refactor Bench评估编程智能体是否能真正执行整个软件代码库的技术迁移,而不仅是让现有测试通过。该基准包含20项迁移任务,覆盖四类技术债务,并检查迁移完成度、行为正确性以及隐藏的行为差异。在8个前沿模型的520次运行中,只有28次通过全部三个阶段,13项任务没有获得可接受的解决方案。表现最佳的Claude Opus 5得分为47.0分。结果显示,智能体经常跳过迁移,或在尝试迁移时
智谱宣布上线并以MIT协议开源多模态模型GLM-5.3-Flash(320B-A18B)。该模型总参数320B、激活参数18B,支持100万Token上下文,并采用稀疏注意力与线性注意力混合架构及mHC技术。据Artificial Analysis评测,模型得分57分,与Claude Opus 4.8持平,高于文中提到的GLM-5.2和DeepSeek V4 Pro。智谱称其调用价格仅为部分竞品旗
腾讯混元团队将旗下18亿参数的端侧翻译模型Hy-MT2大幅压缩。2-bit版本大小为574MB,1.25-bit版本则将原本3.3GB的模型压缩至440MB。方案结合了弹性量化、量化感知蒸馏,以及腾讯自研的Sherry稀疏三值量化技术。英特尔针对包括最新酷睿Ultra在内的x86处理器,对低比特矩阵运算进行了适配和优化。哔哩哔哩已将该压缩模型用于直播弹幕实时翻译。完整下载资源约600MB,运行时内
Anthropic公布了一项试点计划的研究结果,允许三名外部研究人员访问有关Claude实际使用情况的汇总数据。其中一项研究发现,用户会将高风险或高重要性的任务交给人工智能处理。这些结果有助于了解Claude的实际使用模式,但并未证明人工智能决策的质量,也未证明将重大任务交给人工智能是安全的。
小鹏发布了第二代 VLA 驾驶模型的新版本。X-Foresight 世界模型可提前模拟周边交通参与者未来 6 秒内的可能行为,例如前车突然刹停或行人改变方向。系统结合 Flow Matching 生成多种未来情景,利用 Infini-VLA 保留更长的时间上下文,并通过混合架构将不同驾驶任务动态分配给专门的模型组件。小鹏称,流式自回归推理使端到端响应速度提升 300%,实现边观察、边推理、边行动。
RetrievalRouter 是一个轻量级、面向查询的文档检索路由器。它仅根据查询文本,在文本与多模态流程,以及密集检索与晚交互架构之间选择最适合的检索方案。在金融和科学文档基准测试中,没有任何固定流程能在所有查询上保持最佳表现。与最优固定基线相比,RetrievalRouter 的准确率提高 2.5%,速度提升 12.4 倍。通过一个可调参数,用户可以控制完整的准确率与延迟权衡范围。研究团队已
小鹏汽车通用智能中心负责人刘先明表示,第二代视觉—语言—动作(VLA)模型首次将时间维度纳入模型。新推出的 Infini-VLA 长时序架构可记忆此前 30 秒的环境信息,为驾驶判断提供更长的上下文。小鹏还采用流式自回归推理,并宣称端到端响应速度提升 300%,使模型能够在道路状况不断变化时并行完成观察、思考和行动。相关性能数据来自小鹏的企业介绍,报道未提供独立测试或第三方验证。
一项受控研究比较了 Next-Chunk 推理强化学习与 Mixed SFT。后者是一种更简单的监督微调方法,同时使用无 CoT 数据和长 CoT 数据进行训练。Mixed SFT 在 RLVR 后的性能上限明显更高,而所需训练算力减少了 60 倍以上。这一优势在领域内数学推理和领域外推理任务中均得到体现。研究表明,Next-Chunk RL 的收益可能主要来自更有效地利用无 CoT 数据,而不一
JoyAI-Echo-1.5 是一套面向长视频和交互式世界的音视频生成系统。长视频版本通过跨镜头记忆和从语音中提取的说话人信息,在多个场景中保持角色外观和声音身份的一致性。世界模型版本将导航输入转换为经过校准的六自由度摄像机轨迹,从而支持不同控制器和视角的交互。研究团队还将双向音视频骨干网络改造成因果式少步生成器,并利用模型自行生成的长短期 rollout 进行训练,以提高长时生成的效率和稳定性。
一项研究分析了在长期编程任务中,于低成本、低能力模型与高成本、高能力模型之间切换的影响。接收模型必须延续另一个模型生成的任务轨迹,包括工具使用和代码修改。对 Claude 和 GPT 模型组合的测试显示,切换到更强模型时,即使传递完整轨迹,也只能弥补不到一半的能力差距,同时带来显著的成本溢价。相比之下,切换到更便宜的模型能实现更有利的成本与质量平衡。最佳的轨迹信息量也取决于切换方向。
大型视觉语言模型在将用户界面转换为代码方面取得了进展,但其测试时的迭代式自我改进仍不稳定。RubSE 框架利用结构化评分类目,将视觉反馈转化为范围明确的修复目标。每轮迭代选择一个优先目标,并保存此前目标的历史记录,从而减少重复或过于宽泛的修改。在六个视觉语言模型和三个 UI-to-Code 基准上的评估表明,RubSE 比朴素的自演化方法产生了更稳定的优化轨迹和更好的结果,并提升了从严重视觉回归中
该研究提出Video-IFBench,用于评估多模态大语言模型在视频理解过程中遵循指令的能力。基准包含1500个样本、32种任务类型,以及涵盖语义和格式要求的39类约束。研究人员测试了20多个近期模型,结果显示,当前模型在处理包含大量约束、语义要求,或需要根据视频和音频内容选择正确条件分支的复杂指令时,仍然面临明显困难。
一项研究提出了 Gated Recurrent Transformer,通过反复执行共享的 Transformer 核心,并利用更新门调节每次循环。该方法旨在减少每层使用独立参数的需求,同时保留深层模型的功能多样性。在相同计算量下,三层模型达到了与 12 层 GPT-2 Small 基线相当的准确率。在参数和数据预算相同的情况下,更深的循环结构取得了 2.76 的验证损失,优于非循环模型的 2.8
WarpSAC研究大规模并行仿真如何改变离策略强化学习的训练方式。在八类基准测试中开展的受控实验表明,参数归一化和截断双Q等常见稳定化方法高度依赖数据规模。该方法根据数据环境调整稳定化策略,并按经验的新旧程度对回放数据加权。与FlashSAC相比,WarpSAC在九个CPU规模环境中的归一化得分—步数AUC提升4.5%,在14个GPU并行环境中提升23.1%。在Unitree G1运输任务中,成功