文中监督微调(SFT)是推理模型与“推理力度”控制的核心后训练手段之一。Tülu 3、Kimi K1.5 及完整 DeepSeek-R1 都在 SFT 检查点上再做 RL;Qwen3 用含 /think 与 /no_think 样本的 SFT(Thinking Mode Fusion)学会开关思考;实现多档 effort 时,也可在 RLVR 之后用不同长度的目标回答做 SFT,让模型把 effort 标签与推理篇幅关联起来。Nemotron、GLM-5 等亦依赖 SFT 引入中等力度、截断预算或多轮思考格式。
Controlling Reasoning Effort in LLMs
SFT