信源:X:karminski (@karminski3) · 👁️ 47289 次研读

DeepSeek R1 长思考与蒸馏小模型往事回顾

💡 灵机 AI 深度洞见与核心提炼
DeepSeek R1 长思考表现从 71.0% 飙升至 86.7%,并将 R1 生成的长思维链蒸馏到 Qwen-1.5B、7B、14B 小模型,运行时给足思考预算后解题能力随思考长度正相关暴涨。作者借此回顾去年 ollama 将 deepseek-r1-distilled-qwen-7b 当作 deepseek 装到用户电脑上的事件。
信源媒体:X:karminski (@karminski3)
访问出处网页 ↗
阅读原文出处 ↗