在斗象科技的AIBeat平台上,一项旨在揭示大型模型内在思维过程的实验让人惊讶。该团队对全球15个先进的大模型进行了思维链(CoT)提取测试,结果出乎意料:在备受瞩目的GPT-4和Claude 3.5中,反而Gemma 4系列的表现最为优秀。
实验的实施方式是将15个模型分为三组,每组有5个,并对它们进行统一的CoT思维链提取测试。CoT思维链指的是模型在得出答案之前的内部推理逻辑步骤。能够准确提取出这些逻辑步骤,不仅有助于理解模型为何给出某个回答,还是AI安全审计和可解释性研究中的关键要素。
测试结果显示,Gemma 4及其微调版本在提取的准确性方面表现最佳,成功率远高于其他模型,尤其在涉及复杂推理的量子校准实验分析中展现出了显著优势。而业界的标杆模型GPT-4和Claude 3.5则不幸在提取过程中出现较大的失败率。
为什么这些强大的模型会“失手”?报道提到了一种可能性:这与模型对量子校准实验理解的程度,以及提取算法与模型内部机制之间的匹配度有关。换句话说,这并非因为GPT-4无法推理,而是其推理过程过于复杂,使得现有的提取手段难以深入。
其他一些模型如Qwen、Llama和Mistral也参与了此次测试,但其表现参差不齐——有些模型可以提取出部分信息,而有些则完全没有结果。整体而言,这些模型的稳定性普遍不及Gemma系列。
这一实验对行业的启示是,模型的强大能力与其推理过程的可读性并不总是成正比。在选择模型时,如果只关注性能指标,可能会选择一个推理过程隐蔽的黑箱。相比之下,Gemma 4作为开源模型在可解释性方面更具优势,这对于进行AI审计和安全合规的团队来说尤为重要。
当然,这仅仅是一项实验,样本和场景是有限的,因此不能下结论给出模型的能力排名。但至少它提醒我们:当你想了解到AI的思维方式时,选择合适的工具和模型比你想象中更为重要。