RORIRI
·

我大概理解 Sonnet 5 或者整个 Claude 五代模型出了什么问题。他们的 RL 策略大概率是搞坏了,正常的推理过程应该是先找依据,然后推演出结论。它的思维过程反转成先给出暴论,然后为这个暴论找理由,GLM 新一代模型和 OpenAI 上一代模型也都有这个问题。这样的思维方式你加再多个 But 和 Wait 都救不了,并且让整个模型的表达变得偏执且没有逻辑。

0 0

Comments

Empty state graphic

No comments here,

Why not write something?