机械荟萃山庄

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
热搜: 活动 交友 discuz
查看: 55|回复: 0

千问Qwen3.8-max模型:喜欢长篇大论 但逻辑混乱

[复制链接]

2万

主题

3万

帖子

22万

积分

超级版主

Rank: 8Rank: 8

积分
226200
发表于 前天 22:12 | 显示全部楼层 |阅读模式



qwen3.8-max思维链的推理动作,每个动作都只做一半。

qwen3.8-max应该是把其他模型的思维链数据拿来蒸馏,所以模型学会了分点、质疑、小结这些框架性的东西,但是丢失了深度推理、排除、收敛这些精髓。
这就解释了为什么qwen3.8-max喜欢写金句。蒸馏让模型记住了什么时候该质疑,该小结。而通常情况下在小结或转折的位置,天然就伴随着高度凝练、有冲击力的句子。对于学生模型来说,它学到的因果逻辑是:“到达总结位 → 需要输出一个漂亮的句子”。它并不理解这个金句是前面漫长、痛苦推理后的结果,而是把它当成一种格式要求。

推理模型思维链的预期真正的推理模型思维链应该是探索性的,应该充满犹豫、试错和自我否定的。但当思维链被蒸馏成训练数据时,这些元认知指令(如“这里我要强调一下”、“别忘了点题”)被错误地当作了推理的一部分。模型学到的不是“如何想”,而是“如何像高手那样在脑内写稿子”。它在思维链里进行的是一场“脱口秀排练”,而不是“数学演算”。它会因为自己“编出了一个漂亮的包袱”而得意,并提醒自己别忘词。



回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|小黑屋|手机版|Archiver|机械荟萃山庄 ( 辽ICP备16011317号-1 )

GMT+8, 2026-8-14 17:44 , Processed in 0.058350 second(s), 20 queries , Gzip On.

Powered by Discuz! X3.4 Licensed

Copyright © 2001-2021, Tencent Cloud.

快速回复 返回顶部 返回列表