H
Howardism
Plate IIEvals & Benchmarks機器翻譯 · machine-translatedENHOWARDISM

品味要如何撰寫評測?以角色特質作為極限案例

以品味為導向的功能難以評測,但並非無法評測:信念 → 以自用方式發現的失敗訊號 → A/B 變體衡量(MSM 的方法)→ 約 10 個可解讀的判斷編碼評測;此方法已應用於安全/價值觀,溫暖/機智方面仍待探索

Article metadata
Publication details
Published:May 30, 2026
Filed:Essay
Domain:Evals & Benchmarks
Tags:DerivedEvalsLLM CharacterTasteMeasurementAlignment
Reading:8 min
Source:AI-synthesised
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

「品味要如何撰寫評測?以角色特質作為極限案例」的插圖

要化解的悖論#

Cat Wu 提出了兩個看似矛盾的主張。第一,角色特質是最難評測的事物——「程式設計比較容易,因為你可以驗證是否成功;但塑造角色特質,需要非常堅定地相信 Claude 應該成為什麼樣子」(Claude Character as Product)。第二,她說塑造 Claude 角色特質的 Amanda 很擅長評測,「團隊午餐的氛圍檢視也是如此」(Evals as Product Spec)。所以品味難以評測,卻有人能把它評測得很好。解答在於:品味評測不是把單一評分函數接到模糊目標上,而是將信念轉化為可衡量產物的一條流程;三個來源概念各自提供其中一個階段。

三階段技巧#

階段 1——信念是先決條件,不是評測本身#

讓品味變得可評測的要素,位於任何資料集之前:「非常堅定地相信 Claude 應該成為什麼樣子」(Claude Character as Product)。Cat 對 Amanda 職務所做的兩項技能拆解,正好說明了這一點——(1)堅定闡明 Claude 應該成為什麼樣子,以及(2)能說明某個回覆為何符合或不符合角色特質(Claude Character as Product)。技能(2)就是評測技能:「對好表現有強烈見解+能把那份見解轉化為可衡量的產物……將品味化為函式呼叫」(Evals as Product Spec)。沒有信念,角色塑造就會*「趨向平庸的平均值」*;任何以此為基礎的評測也會如此,因為你沒有可據以標記的真實標準。

這就是品味評測不能外包給通用評分準則的原因:評分準則本身就是那份見解。這項技能之所以稀有,正是因為難的是闡明,而非衡量。

階段 2——以自用方式發現失敗模式;透過內省縮小搜尋範圍#

你得先知道「不符合角色特質」在真實情境中是什麼樣子,才能撰寫評測。兩種互補技巧會為評測提供素材:

  • 先從質性觀察出發的氛圍檢視(Dogfooding as Product Discipline):團隊午餐的慣例會問*「你覺得這個模型的氛圍如何?」,並找出具體的失敗訊號——「這個模型太唐突」、「很愛寫記憶,但品質不確定」、「自我測試做得不夠」*(Claude Character as Product)。這是沒有編譯器可用時,評判輸出的自用紀律。
  • 假設 → 資料探查(Model Introspection Feedback):氛圍訊號會指出該查看哪些記錄資料,「方向不是反過來。團隊有太多資料,無法盲目挖掘;默會訊號會縮小搜尋範圍」(Claude Character as Product)。內省提出假設;品味判斷者提供方向;評測則提供證據+迴歸防護欄(Evals as Product Spec)。

評測是整套工具中的最後一項,也是速度較慢、較持久的一項——它將氛圍檢視最初發現、資料探查初步確認的判斷編碼下來。

階段 3——將判斷化為可執行產物,並跨變體衡量#

Model Spec Science 證明了模糊且受價值觀形塑的目標可以透過實證方式呈現,也提供了衡量方法:

  1. 寫下規格,明確描述你想要什麼(憲章是角色特質的文字面向;「角色特質是感受經驗的一面,憲章則是文字規格」——Claude Character as Product)。
  2. 製作兩種變體,並衡量哪一種泛化得更好。MSM 論文正是這麼做:規則規格、價值增補、規則增補;以 Qwen 訓練,再透過 Agentic Misalignment (AM) 行為評測評分(Model Spec Science §5.1)。不同規格之間的差異達到數十個百分點——例如,價值說明讓政策誤用率在不同模型家族中分別從 20%→2% 和 6%→0%。
  3. 將結果回饋至撰寫決策:價值說明勝過單純規則;具體指引勝過概括的「保持有道德」框架(Model Spec Science §5.2)。這就是經過最佳化的品味。

這和 Evals as Product Spec 所描述的基本做法相同——「編碼判斷的可執行產物」——而且兩個概念明確互為映照:model-spec-science 是*「產品面的鏡像……兩者都堅持,看似模糊的產物(規格、角色特質、品味)可以轉化為可執行的驗證」*。

具體做法(綜合整理)#

結合這三個概念:

  1. 陳述信念,寫成簡短而鮮明的評分準則(「不自我膨脹、輕鬆愉快但勝任、誠實而不諂媚」——Claude Character as Product)。這就是規格。
  2. 挖掘自用訊號,找出反覆出現、不符合角色特質的失敗模式;將每一種轉成標記為符合/不符合角色特質的範例配對。
  3. 編碼判斷,建立評分函數——由 LLM 評審組成的小組(The Verifiability Thesis)或由人評分的準則——重現 Amanda 對「這為何不符合角色特質」的解釋。
  4. 跨變體進行 A/B 比較(模型版本、規格版本),衡量偏移情況——將 MSM 的方法應用在你的功能上。
  5. 維持約 10 個,而非 100 個。 每項評測都必須可解讀(失敗時能告訴你哪裡出了問題)、捕捉到你原本會在審查中爭論的判斷,並且易於維護(Evals as Product Spec)。品味評測遵循與其他評測相同的 Goldilocks 原則。

為何這是極限案例,以及仍在哪些地方行不通#

從結構上看,角色特質是光譜中最難的一端,原因有二:

  • 無法乾淨地隔離 A/B 比較。 角色特質會與能力互相作用,因此*「很難說『Claude 很棒』有多少歸因於角色特質、又有多少歸因於推理」*(Claude Character as Product)。評測可以衡量符合角色特質的程度,卻難以將產品成效歸因於它。
  • 驗證者自身的界限。 The Verifiability Thesis 提出的未解問題是:由 LLM 評審組成的小組,對於*「真正有爭議的價值判斷是否成立,還是只適用於品質/連貫性」*,能否做出可靠判斷。角色特質(溫暖、機智)屬於有爭議的範圍,而非連貫性的範圍——所以評審本身也在進行品味判斷,形成遞迴。

證據仍有一處明確缺口:MSM 展示了此方法在安全/價值觀子集上的應用(監督、誠實、不以目的正當化手段——透過 agentic-misalignment 衡量),並未應用於溫暖/輕鬆/機智的個性子集。目前仍未解答的問題——「溫暖/好奇的個性是否也能透過規格科學來最佳化?」(Model Spec Science)——正是 Cat 說 Amanda 擅長、卻*「沒有描述技巧」*的部分(Evals as Product Spec)。因此,對於「Claude 是什麼樣的存在」中可驗證的核心,我們已有經證實的方法;至於其上層的美感表現,仍是一門默會技藝。

為何這些評測經久耐用#

隨著模型進步,多數 harness 資產會縮減(Harness Shrinkage as Models Improve)。角色特質是有文件記錄的例外——「模型之間的能力會改變;角色特質應維持穩定」(Claude Character as Product)——評測也不會縮減,因為它們*「編碼了我們想要的東西;即使模型變得更強,仍必須以此衡量模型」(Evals as Product Spec)。因此,品味評測是少數能累積價值的產物之一:它是迴歸防護欄,讓你能在能力躍升時保留*身分特質,而不必每次發布都重新打造。

結語#

品味評測不是寫好一個評測,而是執行一條流程。信念提供評分準則,自用+內省提供失敗模式並縮小資料搜尋範圍,而MSM 的變體比較方法則將評分準則轉化為可衡量、防止迴歸的產物。此方法已證實可用於角色特質中安全/價值觀的核心;美感表層仍是默會技藝——也正因如此,「擅長品味評測」仍是一項稀有、有人具名的技能,而非有文件記載的程序。

延伸閱讀#

§ end
Cited by 6
  • Evals as Product Spec×2

    How do you write an eval for taste-driven features like character? Amanda's role is canonical for…

  • Model Spec Science×2

    How does this interact with Claude character — is the warm/curious personality also subject to…

  • Open Questions Backlog×2

    Model Spec Science: How does this interact with Claude character — is the warm/curious personality…

  • Claude Character as Product

    Evals For Taste And Character — how the eval-resistant character feature is actually evaluated…

  • Claude Design

    How does Claude Design's eval discipline work for visual/aesthetic output, where there's no…

  • Evals & Benchmarks

    Evals For Taste And Character — Taste-driven features are eval-resistant but not eval-proof: the…

Related articles
  • Claude Character as Product

    Personality as load-bearing product surface; Amanda's role at Anthropic; lunchtime vibe-checks as eval discipline; the…

  • Evals as Product Spec

    Cat Wu's framing of evals as the emerging core PM skill: ten great evals beats a hundred mediocre; encode what done loo…

  • Anthropic

    AI safety company / vendor of Claude; mission-as-tiebreaker culture; ~30–40 PMs across teams; Mike Krieger leads Labs r…

  • Open Questions Backlog

    Generated by `_system/lint.py --write-backlog`. Do not hand-edit. Domain and Watching sections carry one row per page —…

  • Jagged Intelligence (Ghosts, Not Animals)

    "Ghosts not animals": jagged statistical circuits, no intrinsic motivation; car-wash/strawberry failures; stay in the l…