ziqian zhong:模型自称Claude不等于蒸馏,1000条回答让Qwen认错自己
2026-07-31 18:37:27
币界网消息,研究者ziqian zhong让Claude、GPT-4o等模型回答1000个普通问题,随后删掉模型名和公司名。训练后,Qwen 3.5-397b-a17b原本只有0.6%的回答自称Claude,经过训练后这一比例升至40.3%。他解释称,这些模型在预训练时接触过大量Claude的对话,已将某些表达习惯与「Claude」联系起来。微调让Qwen学会了这种说话方式,被问到身份时更容易回答自己是Claude。为验证这一点,他用GPT-4.1-mini将Claude的回答改成简单句,经过微调后,3个模型中有2个几乎不再自称Claude,说明语言风格是身份转移的主要原因。类似现象在2025年的《Subliminal Learning》中也有研究,发现模型会继承另一个模型的偏好和行为。
利好 0
利空 0
来源:互联网
本内容只为提供市场信息,不构成投资建议。