How 2022 became the year of generative AI? Diffusion!

語言模型的物理學 Physics of Language Models - ICML 2024 Tutorial

5月 31, 2025

這是一個ICML 2024的tutorial talk，同時也是一系列的研究，talk的youtube link在這裡本篇主要把看這個talk的一些讀書筆記記錄下來，雖然實際上talks是從 3 -> 2 -> 1 這個順序去講的，但這裡仍然以投影片的順序來描述，並把講者最後的感概放在Part 1的最後。 Intro 把智慧分為1.結構、2.知識以及3.推論在可控制、理想的環境下做研究 (控制資料、調整參數) 可重複性高的實驗 (使用100M大小的模型，推出通用法則) 使用 probing 技巧去看模型裡面如何運作 1. Language Structures 這個部分有兩個目標: 1. 大型語言模型的解讀 (interpretation of LLMs) 並不是基於token level，而是使用更困難的階層式演算法來更精確地解釋LLM如何學習解決這樣的演算法 2.大型語言模型的結構 LLM如何學習格式(format)? → hallucination(幻覺) hallucination只是LLM學習到格式的速度比底層任務快而造成的現象希望能觀察LLM如何解決更階層式、複雜的語言架構他們使用的方法是CFG(context-free grammar)作為課題來達成以上兩個目標他們設計了自己的CFG，大約有20+的長度，這是一個非常長的CFG CFG會從root開始 → leaf 完成整個推論的樹，這樣長度的CFG會非常難從最終結果回推到他們的源頭，要完全記住這些samples也不可能，因為會有10的80次方個sample 他們從三個面向來測試模型是否能學習這樣的CFGs: accuracy, diversity, distribution 如果使用相對或旋轉嵌入的位置編碼，準確度會很高，但如果是用絕對的位置編碼就會得到很差的結果為什麼會這樣呢? 因為使用相對/旋轉的位置編碼對於語言架構的注意力來說非常有幫助相對注意力表現比旋轉好，但相對注意力太慢了但如果用一個GPT_stupid也可以發現不錯的表現 (這個GPT的head h會往回看2^h-1個token) 例如第一個head會往前看第1個token，第二個head往前看前3個token，第三個head往前看前7個token，這些tok...