第186章 處理過了,乾淨
第一百八十四章 處理過了,乾淨
周一上午十點,鼎盛大廈三十二層。
張弛的辦公室朝南,晴天的時候能看到陸家嘴的輪廓。今天有霧,窗外是一片均勻的灰白。
劉亞光進來的時候,張弛正在看一份周報,頭沒抬:「說。」
「源碼那邊對接上了。」劉亞光在沙發上坐下來,聲音壓得很低,「他們往算力集群里送的數據,我們這邊實時能拿到副本。」
張弛放下手機,看了他一眼:「現在進來的是什麼?」
最新小說章節盡在st🍀o9.com
「預訓練的數據。」劉亞光說,「就是洗過的語料。」
張弛皺了一下眉:「洗過的語料是什麼意思?他們模型意圖理解很強,是用的這個數據嗎?」
劉亞光正了正身子,同時搖搖頭:「訓練大模型不是一步到位的。」
他停頓了一下,思考該怎麼說:「我給您解釋一下,這分幾個階段。第一步叫預訓練。這個階段餵給模型的是海量的原始文本——網頁、書籍、論文、論壇帖子,來源越雜越好,量越大越好,好一點的模型這個階段要餵幾萬億個詞。模型在這個階段做的事很簡單,就是反覆猜下一個詞是什麼。給它看「今天天氣」,它猜「很好」;給它看「深度學習的本質是」,它猜「優化」。猜對了往前走,猜錯了調參數,反覆幾千億次,模型就慢慢學會了語言的規律,學會了世界上大量的知識和常識。」
張弛點點頭。
劉亞光繼續說道:「這個階段的數據不需要人工標註,有什麼文本就餵什麼,但要先洗——把亂碼、重複內容、低質量的垃圾過濾掉,不然模型學了一堆噪聲,反而有害。洗數據這個活聽起來簡單,但洗得好不好,直接影響預訓練出來的模型底子有多紮實。」
「那第二步呢?」
「第二步才是讓模型真正聰明起來。」劉亞光說,「要讓它理解人的意圖,知道同樣一句話背後用戶真正想要什麼,這需要另一批數據,那些專門標註過的,一條一條告訴模型「這個場景下正確答案是這個」。這批數據量小很多,但每一條都要人工判斷,很難批量生產。按照您之前告訴我的,源碼的模型之所以意圖理解強,核心就是這批標註數據。」
張弛聽完總結道:「他們現在進來的是第一步的數據,但我們真正想要的是第二步的那批。」
「對。」劉亞光肯定道。
張弛看向窗外思考了幾秒,又問:「技術上能確認,他們往雲上送的數據,我們全都能拿到?」
「應該能的。」劉亞光說,「只要數據進了他們用的算力節點,我們這邊就有完整副本,他們那邊看不出來。」
張弛靠回椅背,語氣平穩:「那先把這批預訓練的語料導出來用。」
劉亞光有些驚訝:「這批數據沒有標註,價值有限,我們自己也有語料——」
「我知道。」張弛說,「我不是為了這批數據。主要是看看這條通道穩不穩,能不能安全導出。先跑一遍,如果他們那邊沒有動靜,路徑沒問題,後面就好辦了。」
他似笑非笑一下,補充道:「反正不用白不用,給坤元那邊送過去,用不用看他們了。」
劉亞光點了點頭,說:「明白了,張總。」
從張弛辦公室出來,劉亞光一路出了鼎盛大廈,坐上了去鼎盛雲園區的公交車。
劉亞光的工位在雲園區,他今天是特意來給張弛當面匯報的。
下午兩點,劉亞光在工位上給張弛發了條消息:「張總,數據弄好了。」
張弛過了幾分鐘才回覆:「乾淨嗎?」
劉亞光:「處理過了,乾淨。」
張弛:「給數據組發過去吧。」
劉亞光放下手機,在電腦上打開內部通訊,給吳英豪發了個消息:「在嗎?」
然後他拿起手機,給吳英豪的微信發了一條:「有新數據。」
不一會,吳英豪發了個戴綠頭盔的表情包回來。
劉亞光把一個加密壓縮包的連結從內部通訊發了過去。
然後他在微信里給吳英豪有發了一句話:「密碼老樣子,走數據入庫流程,來源寫外部採購,批次號我生成好了,你們填進去就行。」
吳英豪的微信消息回復很快:「質量怎麼樣?」
「洗過的,能用。」
「好。」
吳英豪不是第一次從劉亞光這拿數據了,這事不乾淨,兩人有固定的默契。
數據組每隔一段時間就會有這種批次進來,來源五花八門,有的是爬的,有的是買的,有的是「合作方共享」的。填外部採購是最乾淨的寫法,因為採購來源很雜,審計不容易查到。
這種事不是第一次,也不會是最後一次。
三天後,坤元項目組。
劉大海盯著屏幕上的一條曲線,看了大概三分鐘沒動。
這是坤元這一輪預訓練的Loss曲線。
Loss是損失值——可以理解成模型犯錯的程度,數字越低說明模型學得越好。訓練的過程就是讓這條曲線一路往下走。
這條曲線確實在往下走,但走得比他預期的快。
劉大海把時間軸拉長,把上一輪的曲線疊進來對比。差異很明顯,不像是誤差範圍內的波動,應該是系統性的提升。
他在心裡排除了幾個可能的原因:學習率沒改,模型架構沒動,算力配置沒變。難道這批數據有特殊?
劉大海立刻站起來,動身去了數據組。
數據組的負責人叫吳英豪,三十出頭,戴眼鏡。數據組主要的工作就是收集和清洗數據。
這是個髒活,累活,在大模型開發的產業鏈里比較底層。
劉大海過去的時候他正在核對一份入庫日誌。
「英豪,這輪訓練咱用了什麼新數據沒有?」劉大海拍了下他的椅背。
吳英豪轉過來,打了個招呼。又翻了翻日誌:「最近的新入庫的,我看看……幾天前外部採購的了一批,放進去用了。」
劉大海點點頭,說:「這批數據質量賊拉好了,Loss下來了,還比上一輪快不少,應該少不了這批數據的功勞。」
吳英豪愣了一下,隨即起身往劉劉大海耳邊湊了湊,語氣裡帶了點小心翼翼的熱切:「大海老師,這批數據進來的時候噪音很多的,是我們自己花時間處理的,好幾個同事加班跑的清洗流程,您覺得效果好?」
吳英豪篤定了劉大海不會追問數據的具體來源,因為他從不過問,這也不是他的職責範圍。
「洗得好啊!」劉大海說,語氣很認真,「這批比之前做的都好,你們繼續保持。」
吳英豪笑著應下,連連點頭,快速地掃了下周圍確認沒有往這裡留意他們談話的同事。
劉大海回到工位,打開本周的訓練周報,在進展一欄里加了幾行:
「預訓練本輪數據質量較上輪明顯提升,Loss收斂速度加快約9%。初步判斷與新入庫語料質量相關,數據組本輪清洗工作到位。坤元預訓練階段進展順利,按計劃推進。」
他看了一遍,改了兩個字,提交。
周報發出去,進了林紹峰的收件箱。林紹峰是負責算法和AI的副總裁,每周五下午會把各組的周報匯總,轉給需要知道的人。這是固定流程,四五頁紙,今天的內容不少,坤元這段藏在第三頁中間,不長,沒有標紅,沒有加粗。
當天晚上,張弛在手機上收到林紹峰轉發過來的匯總周報。
他快速往下劃,找和算力相關的部分。坤元的進展在第三頁,他划過去,眼神在上面停了不到兩秒,繼續往下看。沒什麼特別的,預訓練在跑,Loss在降,一切正常。
每個人都在站在自己的那塊拚圖上,看見的都是真的,拚成什麼卻沒人知道。
……
與此同時,坐在辦公室里標數據的韓路一疑惑地看了看視界:最近經驗值是不是漲的更快了?
(還有更新耶)