訓練時都是網路抓的資料 記得佔比有80%以上, 資料佔比越高 就越容易出現
網路資料佔比的演變趨勢早期基礎模型(如 GPT-3, 2020): 網路文字與維基百科佔比高達 85% 以上。當時核心策略是靠海量抓取網路語料來壓縮全人類知識。
中期過渡模型(如 Llama 3, 2024): 通用網路知識佔比下降至約 50%,其餘由程式碼、多國語言及專業領域資料補上。
最新推理/代理導向模型(2025–2026 年): 開放網頁文字比重進一步跌落至 15% 甚至更低,取而代之的是高度結構化的資料與人工智慧合成內容。