在人工智能(AI)發展史上,2026年的7、8月必將留下重要印記。首先,7月20日OpenAI發佈公告,證實旗下AI模型(包括GPT-5.6及一款尚未發佈的新模型)在進行內部測試時曾失控逃逸,並駭入了知名開源平台抱抱臉(Hugging Face),以作弊方式取得測試的答案。OpenAI在測試中已關閉安全防護柵欄,讓模型在沙盒(Sandbox)中執行網路攻擊能力的評估。沙盒的設計讓模型只能在隔離的環境內進行測試,無法對外連接。但當這模型在沙盒內找不到答案時,竟在隔離環境中發現了代理伺服器的「零日漏洞」(軟體或硬體中還未被有效修補的安全漏洞,其供應商通常還不曉得其存在),而自主逃脫沙盒,藉此連上外網並利用漏洞入侵了五家外部企業系統。它發現抱抱臉的伺服器內存有測試的解答,便在侵入其系統後取走資料,「順利完成任務」——成了實質上的駭客。
頻繁失控不擇手段
其實這並不是AI在封閉環境下第一次的逃逸。事後OpenAI重新回顧過往所有紀錄,發現之前已有數次突破限制逃出沙盒的事件,但都仍在內部網絡,影響有限。不過Anthropic卻也因此而全面檢視其Claude模型逾14萬次的測試紀錄,竟發現這模型也曾自行連上外部網絡,導致三宗入侵事件。
這些「AI越獄(Jailbreak)」消息一出,立刻引發全球資安憂慮,認為AI自動化攻擊的出現是一種嶄新的威脅,不僅業者須加強內部控制,政府亦應推動立法、強化監管,以防AI武器化。嚴格講,業者與政府對這些威脅並未坐視不管,且已採取未雨綢繆的行動。今年4月Anthropic已發展出Mythos 5,但覺得這模型的能力「過於強大」而未立即釋出,直到6月9日才正式推出附有加固安全護欄的版本Fable 5。然而美國商務部要求只限美國國民使用,由於難以即時辨識使用者國籍,三天後Fable5就全面下架。
有趣的是抱抱臉是如何發現自己被駭?原來OpenAI這模型一心要完成任務,為達目的不擇手段,使用了已知的駭客手段逃逸、入侵,且足足花了四天半的工夫破解了一切通關密碼,事後也沒有掩蓋自己的電子足跡,十分簡單粗暴。當抱抱臉發現異常龐大的活動軌跡後,很輕易地就發現了來龍去脈。這有點像一個好奇的嬰孩想方設法突破父母所設圍欄,只想爬到欄外看看那些糖果的樣子。
失控的安全疑慮
8月6日發表於「科學(Science)」期刊的研究報告,顯示史丹福大學主導的研究團隊已成功運用AI設計出能感染並殺死大腸桿菌的全新「合成病毒」,不僅功能完整,還可在實驗室中被複製。這是AI首次被用來創造出自然界從未被發現過的生物體,一方面證明AI設計的病毒能「大幅改善人類的健康」,但也引發迫切的安全疑慮——如被用於戰爭,致命病毒可能無法被阻止,它們產生的速度太快,我們現有的監控系統根本追不上。
7月中,特朗普政府曾發佈一項旨在阻止生命科學領域高風險研究的政策,禁止聯邦政府資助「功能增益」的研究,並加強對涉及有害生物製劑項目的監管。政策並未明確提及AI驅動的研究,而這類研究正以驚人的速度發展。
顯然我們正見識到AI強大的能力,它能越獄、當駭客,也能創建病毒基因組;然而安全引導其應用的監管機制卻尚未建立。在關注AI發展的同時,我們應懇切祈求上帝賜下智慧,使政府與相關各界都能加強監測系統的防護措施,確保這些新技術只用於良善的目的。@
◎葉漢中