研究发现,将无意义的符号添加到问题末尾,可以显著提升GPT-6 Astra在推理测试中的表现。在一项需要连续推理的测试中,其正确率从约10%跃升至50%;而在数学题目上,其表现也从60%提升至90%。这一变化的关键在于填充Token的使用。
在实验中,Redwood Research的团队让GPT-6 Astra解决复杂的推理问题,例如询问诺贝尔文学奖得主的出生日期及相关的奥斯卡最佳女演员。这类问题需要循序渐进的推理,前一步的答案是后一步的基础。以往参与测试的模型在类似任务上的准确率普遍低于3%。而在加入了“............”这一串空白Token后,Astra大幅提高了其准确率。
除了提升推理效果,研究者还试验了数学题目,发现Astra在处理复杂算式时绩效同样优秀。尽管15个运算并不等于15步推理,但Astra展现了其嵌套计算的优势。 龙8头号玩家
在奥林匹克数学竞赛的相关测试中,旧AIME题目的正确率同样从60%提升至90%。然而,填充Token的效果并不是无限的,其提升的最佳点在8192个Token附近,之后效果趋于平稳。
值得注意的是,研究者并未确切关闭Astra的推理功能,而是采用了低强度推理设置,确保模型直接给出答案并禁用推理过程的输出。在实验过程中,Astra报告的推理Token数为零,但这并不代表模型内部没有进行计算。
研究者们进一步探索了填充Token的位置和形式对推理的影响,结果显示,在题目后添加Token能够提高效果,而在前面则无明显提升。 龙8头号玩家
Redwood Research指出,这种情况引发了对模型思维链监控的担忧,因为传统的监测方法可能无法捕捉到未通过文字表达的内部思维过程。因此,未来的评估应考虑如何更好地测试模型在没有明确推理链输出时的能力,此次实验提出了许多新的问题,挑战着我们对AI推理机制的理解。
揭秘误传的红军女战士王美兰与昔日丈夫的动人故事
提供篮球教练的专业培训课程和认证服务,帮助提升教练员的训练水平。...
斯特列科夫:无需停战,唯有彻底消灭乌克兰
提供篮球教练的专业培训课程和认证服务,帮助提升教练员的训练水平。...