<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>Huang Liang Hsun — Writing</title><description>Research notes and writing by Huang Liang Hsun (lianghsun) — Traditional Chinese LLMs, tokenizers, evaluation benchmarks, and applied machine learning.</description><link>https://lianghsun.dev</link><language>zh-Hant-TW</language><item><title>為什麼我開了這個站</title><link>https://lianghsun.dev/blog/hello-world</link><guid isPermaLink="true">https://lianghsun.dev/blog/hello-world</guid><description>模型卡和論文是整理過的版本。這裡放的是剩下的那些——失敗的訓練、看起來太漂亮的分數，還有沒人問但我想講的 ablation。</description><pubDate>Fri, 28 Aug 2026 00:00:00 GMT</pubDate><category>meta</category></item><item><title>TwinkleTokenizer：為什麼繁體中文需要一個從零訓練的詞表</title><link>https://lianghsun.dev/blog/twinkle-tokenizer</link><guid isPermaLink="true">https://lianghsun.dev/blog/twinkle-tokenizer</guid><description>201K 的詞表打贏 248K，不是因為演算法比較好，是因為對方有 11% 的名額在訓練前就浪費掉了。這篇講設計決策、三層驗證，以及一個差點讓結論反過來的評測錯誤。</description><pubDate>Fri, 28 Aug 2026 00:00:00 GMT</pubDate><category>tokenizer</category><category>zh-tw</category><category>twinkle-ai</category><category>llm</category></item></channel></rss>