">

trl v1.15.0 发布:fused LM head 默认开启,同样显存下可训练更长序列

Hugging Face 的 trl 于 2026 年 10 月 8 日发布 v1.15.0,核心变化是给 SFT、DPO、KTO、GRPO、RLOO 与 Distillation 换上 fused LM head:用 Triton kernel 分块投影后直接归约出每 token 的对数概率,不再构建完整的 logits 张量,且默认开启。同批带来若干破坏性变更。

这次发布的是什么

2026 年 10 月 8 日,Hugging Face 的 trl 发布 v1.15.0(GitHub release 的 published_at 为 2026-10-08T19:26:48Z,非预发布版本)。这次的核心变化是给 SFT、DPO、KTO、GRPO、RLOO 与 Distillation 换上了 fused LM head:用一个 Triton kernel 给 token 打分,不再构建完整的 logits 张量。官方 release 给出的结论是,在同样的显存条件下可训练的最大序列长度显著变长,峰值显存明显下降。同批还带来若干破坏性变更,升级前需要检查脚本。

可用性与限制

  • 获取方式:通过 PyPI 安装 trl,版本 1.15.0;Python 与依赖的版本要求以官方 release 与文档为准。
  • 默认行为:fused LM head 默认开启,官方写明无需手动打开。
  • 硬件前提:官方写明打分路径需要 Triton 与 GPU,支持 Linux 上的 CUDA、ROCm 或 XPU;不满足条件时走不到这条路径。
  • 收益差异:官方称对「小模型 + 大词表」的组合收益最大;SFT 原本的默认 chunked_nll 已经避免完整 logits,因此这一项不变。
  • 破坏性变更:GRPO、RLOO、DPO、KTO 移除了完整 logits 打分路径与前向重定向分支,部分旧参数不再可用。
  • 境内可用性:PyPI 与 GitHub 的可访问性取决于本地网络环境,以实际情况为准。

主要功能

  • 用 Triton kernel 分块投影,直接归约出每 token 的对数概率与 entropy
  • 新增三个可选输出:log_sum_sq_probs、mean_logits 与 is_top1
  • 保留 DPO 与 KTO 中依赖完整 logits 的接口,但标记为弃用并给出警告
  • 移除 GRPO、RLOO、DPO、KTO 中的完整 logits 打分路径与前向重定向分支
  • 把 use_liger_kernel 在这四个 trainer 中标记为弃用,计划于 v2.0.0 移除

技术原理

按官方 release 的说明,过去这些 trainer 需要构造形状为「批量 × 序列 × 词表」的 logits 张量才能算出每 token 的对数概率,词表一大,显存就被这一步吃掉。v1.15.0 改用一个 Triton kernel:把隐藏状态分块送进 LM head 做投影,在块内直接归约成每 token 的对数概率与 entropy,中间那个大张量不再被物化。官方在 gemma-3-1b、词表 262k、bf16、批大小 1、开启梯度检查点、使用 sdpa,并把显存分配器限制在 79 GiB 的条件下给出的对比是:DPO 的最大可训练序列长度从 10,240 提升到 59,392,KTO 从 9,216 提升到 63,488,GRPO 从 28,672 提升到 114,688,RLOO 从 23,552 提升到 100,352,SFT 在 nll 损失下从 20,480 提升到 107,520;SFT 默认的 chunked_nll 保持不变。在 8,192 token 处,官方称峰值显存下降 52% 到 82%,步速快 2.3% 到 10.9%。以上均为官方自测数值,实际结果随模型与环境而变。

实际体验

想确认这次升级对你的脚本是利好还是要改代码,可以这样验证:

  1. 在测试环境里把 trl 装到 1.15.0,跑一遍原有的 DPO 或 GRPO 脚本,看日志里是否出现弃用警告——官方已把 use_liger_kernel 在这几个 trainer 中标记为弃用。
  2. 搜索脚本里是否在 lm_head 上挂了 PEFT adapter;官方写明这种写法现在会直接报错,需要改成把 lm_head 放进 modules_to_save。
  3. 用同一份配置分别跑 1.14.2 与 1.15.0,记录峰值显存与能跑通的最大序列长度;与官方表格对照时注意模型、词表大小与显存上限都要一致。
  4. 确认运行环境有 Triton,且是 Linux 上的 CUDA、ROCm 或 XPU 之一,否则打分路径不会走 fused LM head。
  5. 如果你的 DPO 或 KTO 流程依赖 compute_metrics 或带 return_outputs 的 compute_loss,注意官方说明这两处仍会拿到完整 logits,但来自一次额外的前向传播,且已标记弃用。

项目地址与获取方式

官方仓库为 github.com/huggingface/trl,发布页为 github.com/huggingface/trl/releases/tag/v1.15.0,安装走 PyPI 上的 trl 包。请通过官方渠道安装,避免来源不明的第三方镜像包。升级前建议先读一遍 release 里的破坏性变更一节。

适合谁用

  • 显存受限、训练时被序列长度卡住的微调团队
  • 用 DPO、KTO、GRPO、RLOO 做偏好对齐或强化学习的工程团队
  • 模型不大但词表很大的场景,官方称这类组合收益最明显
  • 不必用:只用 SFT 默认配置的团队——官方写明 chunked_nll 本来就避免了完整 logits,这一项没有变化;也不必用:没有 Triton 与 GPU 的环境,走不到这条打分路径

常见问题

需要改代码才能用上 fused LM head 吗?

官方写明它默认开启,无需手动打开。但如果脚本里有这次被移除的旧写法就需要改:例如在 lm_head 上挂 PEFT adapter 的写法现在会报错,要改成把 lm_head 放进 modules_to_save。

我用了 use_liger_kernel,会出问题吗?

官方写明在 GRPO、RLOO、DPO、KTO 这四个 trainer 中,use_liger_kernel 已弃用,计划于 v2.0.0 移除。Liger 的层 kernel 仍然适用,但 fused_linear_cross_entropy 会被强制关闭,显式设置会报错;官方建议改用模型初始化参数中的 use_kernels。

峰值显存能降多少?

官方在 8,192 token 的条件下称下降 52% 到 82%,并给出各 trainer 的对照数值。这是官方自测结果,实际降幅取决于模型、词表大小与硬件,建议按官方给出的条件自行复测。

没有 GPU 或 Triton 还能用 trl 吗?

官方写明这条打分路径需要 Triton 与 GPU,支持 Linux 上的 CUDA、ROCm 或 XPU。不满足时不会走 fused LM head,具体降级行为以官方文档为准。

升级会影响已经在跑的训练吗?

正在跑的任务不受影响。需要留意的是脚本兼容性:被移除的旧参数会从 v1.15.0 起报错或告警,官方说明相关移除计划指向 v2.0.0,升级前先在测试环境验证一遍。

相关工具与内容

Related
快讯 1 小时前

Anthropic 启动 Cyber Mission,向开源项目开放免费安全扫描 OSS Scanner

Anthropic 于 2026 年 10 月 8 日在官方新闻页宣布启动 Cyber Mission,首批两个方向是保护关键基础设施背后的运营技术与加固开源代码。随计划推出的 OSS Scanner 向开源项目免费提供由模型生成的定期安全扫描,报告含概念验证、说明与建议修复,但不经人工复核即发送,官方提示可能存在不准之处。

前沿快讯 7 阅读
快讯 1 小时前

Google 推出 Playground:用文字提示创建、游玩并分享自定义小游戏

Google 于 2026 年 10 月 7 日在官方博客推出 Playground,一个实验性游戏平台:用文字提示描述想法即可创建、游玩并分享自定义游戏,官方写明不需要编码经验。当天面向美国 18 岁及以上用户开放,创建权限按 Google AI 订阅层级分批开放,与 Unity Spark 的集成仍在测试中。

前沿快讯 5 阅读
快讯 1 小时前

Mastra core 1.75.0 发布:Span 查询 API 上线,trace 聚合可统计 token 与成本

Mastra 于 2026 年 10 月 7 日发布 @mastra/core 1.75.0,重点是可观测性:新增 Span 查询 API,可以不先找 trace 就直接跨 trace 查询已完成的 span,并返回模型成本;trace 聚合开始支持 token 与成本度量,已在 ClickHouse、DuckDB 与 Postgres 三种存储实现。同批把 @mastra/connect 推进到 1.0 稳定版。

前沿快讯 5 阅读

继续阅读:Mastra core 1.75.0 发布:Span 查询 API 上线,trace 聚合可统计 token 与成本 · 天工AI拿到 4.1 分:办公智能体

关于本文:本站文章由编辑部独立撰写,评测口径与免责说明见关于我们。想继续找工具,可从分类导航按场景浏览,或回首页搜索。

链接已复制