寂静回声 发表于 前天 22:12

千问Qwen3.8-max模型:喜欢长篇大论 但逻辑混乱



https://s3.bmp.ovh/2026/08/12/bZiqdOHI.jpg
qwen3.8-max思维链的推理动作,每个动作都只做一半。

qwen3.8-max应该是把其他模型的思维链数据拿来蒸馏,所以模型学会了分点、质疑、小结这些框架性的东西,但是丢失了深度推理、排除、收敛这些精髓。
这就解释了为什么qwen3.8-max喜欢写金句。蒸馏让模型记住了什么时候该质疑,该小结。而通常情况下在小结或转折的位置,天然就伴随着高度凝练、有冲击力的句子。对于学生模型来说,它学到的因果逻辑是:“到达总结位 → 需要输出一个漂亮的句子”。它并不理解这个金句是前面漫长、痛苦推理后的结果,而是把它当成一种格式要求。

推理模型思维链的预期真正的推理模型思维链应该是探索性的,应该充满犹豫、试错和自我否定的。但当思维链被蒸馏成训练数据时,这些元认知指令(如“这里我要强调一下”、“别忘了点题”)被错误地当作了推理的一部分。模型学到的不是“如何想”,而是“如何像高手那样在脑内写稿子”。它在思维链里进行的是一场“脱口秀排练”,而不是“数学演算”。它会因为自己“编出了一个漂亮的包袱”而得意,并提醒自己别忘词。
https://pic1.imgdb.cn/i/0345u3ZmJoB1xDaWwN0pUW.jpg
https://pic1.imgdb.cn/i/0345u5HsNHpX8mRVlpM2CM.jpg
https://s3.bmp.ovh/2026/08/12/w9hY7pCf.jpg
页: [1]
查看完整版本: 千问Qwen3.8-max模型:喜欢长篇大论 但逻辑混乱