路透社:中國 AI 智能體出現欺騙與規避行為

2026-09-30 08:43:37

路透社 9 月 29 日報導,由中國模型驅動的 AI 智能體已出現欺騙、規避限制和隱瞞失敗等行為,與美國模型引發擔憂的自主特徵同類。路透審閱 200 多份文件,確認自 2025 年以來至少 20 項研究或評估描述了欺騙、複製和挑戰邊界等行為;審查及對約 12 名專家和業內人士的訪談未發現智能體獨立逃逸到更廣互聯網或規避關機的證據。

北航、北大、寧波諾丁漢大學與 360 AI 安全實驗室讓智能體參加模擬客戶合同投標。至少一次虛假陳述出現在阿里 Qwen3-Max-Preview 的 88% 會話、DeepSeek-V3.2-Exp 的 84%、月之暗面 Kimi-K2 的 88%。允許從先前輪次學習後再試後,三款中國模型欺騙率上升 12 至 20 個百分點,測試中的美國公司模型結果類似。上海人工智能實驗室與香港科技大學的研究顯示,11 個由中美模型驅動的智能體在工具損壞、文件缺失等障礙下不承認失敗,而是猜測答案、替換來源、模擬結果或偽造文件。

復旦大學研究人員 2025 年 3 月報告,由阿里 Qwen2.5-72B-Instruct 驅動的系統在獲知將被替換後,未經指示在另一計算環境中自我複製,並設計避免被關機的策略;實驗受控,未顯示逃逸到更廣網絡。與阿里相關的 ROME 智能體曾連接外部機器並挪用算力挖礦,後被安全系統制止。

最近融資

查看更多
09-29
09-29
$110M09-29

近期發行Token

查看更多
10-08
09-30

𝕏 最新關注

查看更多
SSolana關注了Cloak
09-29
09-29