Builder's Scorecard 方法論
這是一套讓 Builder 看見自己盲區的尺,不是給答案的考試。
緣起:從 Lucy Chen 的 VC 評分卡到尋常 Builder 的工具
這套工具的起點是 Lucy Chen 在 Facebook 分享的開源投資評分框架。 Lucy 是新加坡 Zoo Capital 的 EIR,管理規模超過 20 億美金的基金。她設計的框架來自實戰: 在 NVIDIA GTC 之前,她用這套評分卡標記了 LMCache 這個項目,給出「黑馬」評級; 兩週後 NVIDIA 發布 Dynamo 1.0,把 LMCache 收編進官方整合名單。
但 Lucy 的框架是為 VC 設計的——考慮出場路徑、團隊國際化、社群治理、資本效率。 對一個靠 AI 獨力做工具的 Builder 來說,這些維度不對稱。我需要的不是投資建議, 而是一面誠實的鏡子:這個產品,真的解決問題嗎?真的有人需要嗎?
三大改動
我從 Lucy 的框架出發,做了三件事:
- 拿掉「團隊能力」維度。 一個 Builder 可能同時維護十個產品,「團隊能力」在這個語境下沒有鑑別力。 我把它抽離成不計分的 Builder Profile 前置欄位——留給 AI 參考,不影響總分。
- 新增「問題解決力」維度(25% 最高權重)。 你解決的問題是你自己假想的,還是真的有五個以上的人獨立描述過這個痛點? 現有替代方案是什麼?你的解法比現有方案好多少——是 10 倍還是略好? 這些問題應該是任何 Builder 在動手之前第一個被問的。
- 商業化維度做了階段適配。 一個還在概念期的 side project 被問「月經常性收入多少」是不公平的, 但被問「你有沒有想過怎麼賺錢」是合理的。 使用者先選產品階段(概念期 / 已上線 / 有用戶 / 有收入), 不同階段會看到完全不同的評估訊號。
五維度與權重
| 維度 | 權重 | 核心提問 |
|---|---|---|
| 🎯 問題解決力 | 25% | 你解決的問題是真實的嗎?有現有替代方案嗎?你的解法比現有方案好多少? |
| 📊 市場驗證/牽引力 | 20% | 市場有沒有用行動告訴你「我要這個」?回訪、口碑、付費意願這些行為訊號。 |
| 🏰 技術護城河/可防禦性 | 20% | 換掉底層模型後,這個產品的優勢還在嗎?看的是專有資料、分發、轉換成本,不只是技術難度。 |
| 💰 商業化路徑 | 20% | 階段適配(概念期問思路、已收入期問 MRR) |
| 🔮 長線可持續性 | 15% | 大廠威脅、維運負擔、生態定位 |
28 個訊號
每個維度下有 4–6 個訊號,每個訊號打 0–10 分,加權算出維度分數。
🎯 問題解決力(6 個訊號)
- 問題真實性:≥5 人獨立描述過這個痛點為強訊號,只有你自己覺得需要為弱訊號。
- 現有替代方案:現有方案極度痛苦或不存在為強,已有好用的免費方案為弱。
- 解法匹配度:用戶說「這正是我需要的」為強,功能很多但核心痛點沒解決為弱。
- 10x 改善:至少好 10 倍(可量化)為強,略好不值得用戶改變習慣為弱。
- 目標用戶清晰度:精確到職業和場景為強,「所有人都能用」為弱。
- 問題頻率:每天或每週發生為強,一年一兩次為弱。
📊 市場驗證(6 個訊號)
- 活躍使用者:過去 30 天 ≥50 個獨立用戶為強,只有你自己為弱。
- 回訪行為:≥40% 在 7 天內回訪為強,<10% 或無法追蹤為弱。
- 使用深度:深度使用核心功能為強,打開首頁就離開為弱。
- 口碑傳播:有具體推薦案例為強,無為弱。
- 外部反饋品質:具體的功能建議和場景描述為強,只有「不錯」為弱。
- 付費意願訊號:有人主動問如何付費為強,零付費對話為弱。
誠實標註:這個維度量的是「你有沒有提出驗證證據」,不是工具替你量到了 PMF。 Scorecard 讀的是你給的文字與 GitHub 內容,量不到真實的回訪曲線或留存數字。 所以這一維高分代表你提供了可信的驗證取徑,不代表已達成產品市場契合。
🏰 技術護城河/可防禦性(6 個訊號)
核心問法 Sovereignty Test:換掉底層模型後,這個產品的優勢還在嗎? 這 6 個訊號分兩組:c2/c3/c4 問「你沉澱了什麼別人補不齊的資產」,c5/c6 問「你綁住了什麼結構優勢」,c1 是統攝兩組的軸心。 問的不再是技術難不難,而是換掉模型後優勢還在不在。
- 模型替換存活性:換掉底層模型後優勢仍在、價值來自專有資產為強;薄 wrapper、換模型優勢歸零、一個週末可複製為弱。
- 領域 context 累積深度:自建領域規則庫 / 工作流 / 整合、重建得懂這行且花數月為強;通用功能套通用模型、幾天就能做為弱。
- 專有資料資產與飛輪:有獨家資料且有飛輪、越用越難追為強;資料全靠公開來源、無任何專有沉澱為弱。
- 領域 eval 與品質護欄:有自建 eval harness / 回歸基準 / 品質護欄、能持續守住為強;無任何可重現的領域驗證、只靠直覺為弱。
- 轉換成本與用戶鎖定:資料 / 工作流 / 整合都沉澱在產品內、搬走=重建為強;用完即走、零沉澱、明天可無痛改用同類品為弱。
- 分發與網路效應:有自有分發渠道或網路效應、越多人用對每個用戶越有價值為強;純單機工具、無分發無網路效應為弱。
💰 商業化路徑(依階段 4 個訊號)
根據選擇的產品階段顯示不同訊號:
- 概念期:商業模式假設、目標市場規模、付費意願初探、成本結構。
- 已上線:定價策略、獲客管道、營運成本可控度、免費→付費路徑。
- 有用戶:收入模式、付費轉換率、獲客成本、成本回收率。
- 有收入:月經常性收入、客戶集中度、毛利率、收入成長率。
🔮 長線可持續性(6 個訊號)
- 供應鏈韌性:每個關鍵依賴都有 fallback 為強,核心功能完全依賴單一服務為弱。
- 大廠威脅:差異化來自大廠不會做的事為強,大廠已在做或即將做為弱。
- 維運負擔:<2 小時 / 週(高度自動化)為強,>10 小時 / 週為弱。
- 文件化程度:完整可交接、別人拿到能跑為強,全在腦子裡為弱。
- 演化路徑:有 2–3 個明確的延伸方向為強,做完就這樣為弱。
- 法規 / 合規:已確認合規且有隱私政策為強,不確定為弱。
怎麼解讀分數
這個分數不是考試成績。低分不代表你的產品「不好」——它代表某些維度還沒準備好。
真正重要的不只是總分,而是雷達圖的形狀。 一個 6.0 分但五角均勻的產品,比一個 7.0 分但某個維度是 1 的產品更健康—— 但也可能是你刻意為之。分數給你的是一個對話起點,不是一個裁決。
評分閾值參考:≥8.5 全力推進 / 7.0–8.4 有條件推進 / 5.5–6.9 觀望補強 / <5.5 建議暫停或轉向。 若觸發一票否決條件(如零用戶超過 60 天、成本失控),無論總分多高都建議先暫停。
評分只看實質證據與論證強度,不看你寫得多長。長篇但空泛不會加分,簡短但有強證據一樣拿高分。
每個維度旁會標「證據充分度」:你給的輸入夠不夠評這一維。 證據不足時,分數以區間呈現並標出缺口,而不是假裝有把握。
三個案例對照
| 產品 | 分數 | 雷達圖形狀 |
|---|---|---|
| LangChain | 8.02 | 13 萬 stars、3,659 contributors、LangSmith 付費產品。五個維度都在 7 分以上,只有長線可持續性因大廠威脅稍低。 |
| Lucy 的 OSS Investment Scorecard | 6.82 | 框架扎實、問題真實;233 stars、2 個 contributor、零收入模式。問題解決力和技術強,商業化維度偏低。 |
| 阿哥拉廣場(即時翻譯) | 5.01 | 技術強(問題解決力 7.0、技術護城河 6.2),市場空白(市場驗證 4.0)、商業化幾乎沒有(2.0)。典型工程師產品形狀。 |
三個產品,三種完全不同的雷達圖形狀。分數有區分度,且區分的方向符合實際觀察。