人工智慧的答案不僅聽起來合理
谷歌研究院發表了一篇論文,研究如何使生成式人工智慧系統產生的答案不僅僅是聽起來合理的。研究人員表示,他們的 ALDRIFT 框架“開闢了令人興奮的途徑”,超越了僅僅具有高機率的答案。
這篇論文的標題是“透過粗略學習能力對生成先驗進行樣本有效優化,」研究了一個問題,其中生成的答案必須在模型下保持可能,同時也朝著單獨的目標邁進。該研究指出了解決人工智慧合理性陷阱的新途徑。
谷歌始終
論文中的證據集中在一個名為 ALDRIFT(演算法驅動的目標迭代擬合)的框架上。此方法反覆細化產生模型以獲得更低成本的答案,並使用校正步驟來減少過程中的累積誤差。
論文也介紹了「粗略的可學習性」。該術語意味著學習的模型不需要完全匹配理想目標。它需要對答案空間的重要部分保持足夠的覆蓋,這樣有用的可能性就不會過早失去。在這個假設下,作者證明 ALDRIFT 可以用多項式數的樣本來近似目標分佈。
ALDRIFT 的運作分為兩部分
ALDRIFT 的運作分為兩部分:
- 生成模型表示在該模型下仍可能出現哪些類型的答案。
- 外部評分過程衡量候選答案是否在目標目標上表現良好。
作者將該分數描述為「成本」。 「成本」一詞是指分配給候選答案的測量懲罰。較低的成本意味著候選人根據所檢查的要求做得更好。 ALDRIFT 並不簡單地尋找任何低成本的答案。它尋找得分良好的答案,同時在生成模型下仍然有可能。
一些人工智慧答案需要整體發揮作用
研究人員專注於人工智慧解決問題的答案,這些問題的回應必須在現實世界中發揮作用,例如路線規劃和會議規劃的範例。
- 路線規劃:本文解釋說,法學碩士可以評估各個路線段是否風景優美,但可能很難確保這些路線連接成有效的路徑。
- 會議規劃:法學碩士可以按主題對會議進行分組,而可能需要經典演算法將這些會議安排到時間表中而不發生衝突。
這些例子說明了為什麼本文將看似合理的答案僅視為問題的一部分。更困難的問題是,當單獨的部分必須作為一個完整的解決方案一起工作時,產生保持一致的答案。
粗略的可學習性假設
該論文將此視為引導生成模型得出將所有部分結合在一起的答案的問題。作者將問題與推理時間對齊聯繫起來,即根據特定答案是否可以作為完整的解決方案在使用過程中調整模型。這種關聯賦予了研究實際意義,儘管本文的貢獻仍然是理論上的並且取決於粗略的可學習性假設。
「粗略可學習性假設」一詞意味著論文的理論依賴於這樣一個假設:模型可以在獲得更好答案的同時保留足夠的有用可能性。
這並不意味著模型必須完美地學習目標。這意味著模型必須保留足夠的答案空間覆蓋範圍,以便該過程不會過早陷入困境或失去可能的更好答案。
現有的最佳化方法留下樣本有限的差距
該論文指出如何理解現有最佳化方法的幾個差距:
- 現有方法的限制: 基於經典模型的最佳化方法依賴於「漸近收斂論證」。這意味著它們在理論上可以在大量採樣後被理解,但不一定在樣本有限的實際環境中。
- 表達模型的失敗: 該論文表示,當使用神經網路等表達生成模型時,這些經典假設就會「失效」。
- 理解上的差距: 作者表示,在這種情況下優化的「有限樣本行為」「理論上沒有特徵」。這意味著該理論無法完全解釋當只有有限的樣本可用時這些方法的行為。
論文的解決方案是引入「粗略可學習性」來解釋如何將生成模型推向更好的答案,同時保持足夠的有用可能性。
法學碩士證據有限
該論文的主要證明適用於分析生成模型,該模型比現代法學碩士更容易進行數學分析。 LLM 的證據範圍更窄:作者在簡單的調度和圖形相關問題中使用 GPT-2,顯示了支持該想法的行為,但沒有證明相同的假設適用於現代 LLM。
該研究為未來研究奠定了基礎
本文為研究產生模型如何與外部檢查過程結合提供了理論基礎。
研究表明,Google研究人員正在探索一個解決「合理答案」問題的框架,作者寫道,「該框架為未來的研究開闢了令人興奮的途徑。」他們的結論是,這項研究「為自適應生成模型奠定了原則基礎」。
重點
- 「覆蓋範圍」要求:
粗略的可學習性意味著模型不必完美地學習目標。它需要避免在丟失答案空間中可能存在更好解決方案的有用區域。 - 糾正步驟很重要:
當模型被推向更好的答案時,ALDRIFT 使用校正步驟使搜尋更接近預期目標。 - 兩部分方法:
該框架採用分工。生成模型處理定性或語義偏好,而單獨的過程則檢查答案是否可以作為完整的解決方案。 - 有限的法學碩士證據:
GPT-2 的測試顯示了支持簡單調度和圖形相關示例中想法的行為,但不能證明相同的假設適用於現代法學碩士。 - 現實世界的使用是更大的目標:
這項研究對 SEO 和企業很重要,因為人們越來越期望人工智慧答案不僅能夠概括資訊。他們需要支援聊天介面之外的決策、計劃和行動。雖然該框架可能不會在生產中使用,但它確實表明谷歌在提供合理的答案方面正在取得進展。
在這裡閱讀研究論文:
透過粗略學習能力對產生先驗進行樣本有效優化 (PDF)
精選圖片由 Shutterstock/Faizal Ramli 提供
