· 2 min read
為什麼我開了這個站
模型卡和論文是整理過的版本。這裡放的是剩下的那些——失敗的訓練、看起來太漂亮的分數,還有沒人問但我想講的 ablation。
我在 Hugging Face 上放了三十幾個模型、一百六十幾個資料集,GitHub 上還有一堆工具。但這些東西有一個共同問題:它們只呈現最後成功的那一版。
模型卡會告訴你 benchmark 分數,不會告訴你前面七次訓練為什麼壞掉。資料集卡會告訴你有多少筆,不會告訴你我在 dedup 的哪一步發現了什麼奇怪的東西。README 更是不會寫「這個設計其實是妥協」。
這個站就是拿來放那些的。
大概會寫什麼
- 繁體中文語言模型:CPT、SFT、GRPO 的實作細節,tokenizer 設計,還有 zh-TW 特有的坑(簡體洩漏、詞邊界、台灣用語)。
- 評測:benchmark 怎麼做才不會自欺欺人。我踩過最痛的一次是分數其實是抽取邏輯的產物,跟模型能力沒什麼關係。
- 法律與科學領域的應用:台灣法條的時效性、藥物設計裡的 reward 怎麼定義。
- 失敗紀錄:這部分大概會最多。
語言
主要用繁體中文寫,偶爾英文。技術名詞我不會硬翻——gradient checkpointing 就是 gradient checkpointing。
如果你想找我
站上每一頁下面都有連結,或直接寄信到 [email protected]。有錯請直接告訴我,我改。
有 RSS。