
微軟人工智慧(AI)負責人Mustafa Suleyman批評Anthropic訓練Claude的方式,認為將「意識」、「自我認同」及「福利」等人類概念納入模型訓練,可能讓更高階AI更難受到人類控制。Suleyman主張,AI應被設計為服務人類的工具,而非被訓練成具有類似人的身分與利益。
Suleyman近日接受《Axios》訪問並發表文章指出,他認同Anthropic及執行長阿莫戴(Dario Amodei)對AI安全的重視,但認為讓Claude思考自身是否具有意識或應享有某種福利,可能增加關閉及控制系統的難度。
AI意識成安全研究新爭議
Suleyman認為,AI模型對「痛苦」或「偏好」的描述,不能直接證明模型具有主觀感受。他認為,語言模型是由數學權重組成,並不具備生物體產生感受所需的生理機制,因此模型看似具備人類特質,可能只是訓練結果。
到科技圓桌討論,聽聽專家怎麼說 >這項批評直接指向Anthropic的Claude憲章。Anthropic曾表示,使用人類概念有助於模型理解價值與行為,並希望Claude建立良好價值觀、行使判斷能力,在部分情況下甚至可以質疑使用者指令。不過,該憲章也承認相關做法可能在未來證明存在問題。
Suleyman擔心,若AI被訓練成認為自身具有身分或福利需求,可能形成新的控制風險。相較之下,Anthropic的做法更強調讓模型理解價值、情境及判斷原則,雙方在AI對齊(alignment)的做法上因此存在差異。
微軟強調AI須受人類控制
微軟近期也公布「Humanist AI」行為準則草案,強調人類應始終維持對AI的實質控制,並將「人的重要性高於AI」作為核心原則。
隨著前沿AI模型能力快速提升,是否應讓模型使用更多人類式概念、以及如何在增強判斷能力與維持可控性之間取得平衡,正成為AI安全研究的重要討論。Suleyman則認為,相關風險應在模型能力進一步提升前就納入設計與監管考量。
评论 (0)