ziqian zhong:模型自称 Claude 不等同於蒸餾,1000條回答讓 Qwen 變得認錯自己
2026-07-31 18:37:27
幣界網消息,研究者 ziqian 和 zhong 讓 Claude、GPT-4o 等模型回答1000個普通問題,隨後刪掉模型名和公司名。訓練後,原本只有0.6%的回答稱自己為 Claude 的模型,經過訓練後這一比例升至40.3%。他解釋稱,這些模型在預訓練時接觸過大量 Claude 的對話,已將某些表達習慣與「Claude」聯繫起來。微調讓 Qwen 學會了這種說話方式,被問到身份時更容易回答自己是 Claude。為驗證這一點,他用 GPT-4.1-mini 將 Claude 的回答改成簡單句,經過微調後,3個模型中有2個幾乎不再稱自己為 Claude,說明語言風格是身份轉移的主要原因。類似現象在2025年的《Subliminal Learning》中也有研究,發現模型會繼承另一個模型的偏好和行為。
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。
關注HQYC官方帳號,及時關注最新動態






