Autoresearch 在個人 IP 場景的正確具身:不是讓網站自己懂機器,是讓 Agent 們一起懂我
要約
Paul Kuo 實驗將 Karpathy autoresearch 框架具身到個人 IP 站台(paulkuo.tw),設計自動 mutation engine 讓網站檔案自我優化。七週後系統無聲失效,他透過 Chat、Cowork、Codex、Code 四個 session 的分布式議事發現核心問題:誤將 llms.txt 視為可追逐的成長槓桿(實際是衛生指標),將三個不同 reward 結構的身分(個人 IP 站、工具站、寫作站)強行綁定於同一引擎。重大 reframing 是:個人 IP 場景的正確具身不是完全自主系統,而是五方議事(Chat-Cowork-Codex-Code-Paul)的分布式 autoresearch v2,透過不同視角互補各自的盲點。整個思考過程本身成為案例。
要点
- mutation engine 把尚未收斂的行業慣例誤當成核心訊號,llms.txt 是衛生指標非成長槓桿
- 個人 IP 站 reward 訊號稀疏延遲,無法自動閉環,與 product 類型的 v0 範式不可比
- 三身分 category confusion:個人 IP / 工具站 / 寫作站的 reward 結構差異導致七週靜默失效
- 分布式 autoresearch v2 核心是五方議事桌各自獨立長處互補,而非單一自主代理
- 範式正確後優化方法才有意義,選錯載體再好的方法也無法收斂
チャプター
- Autoresearch 的個人 IP 具身實驗
Paul Kuo 實驗將 Karpathy autoresearch 套用到 paulkuo.tw 站台,設計 mutation engine 讓白名單檔自動優化,期望在三月內持續改進分數。
- 七週無聲失效與發現
系統於三月中停擺,五月才被發現。experiments.json 變成 0 bytes,沒有 alert 機制,代表治理的最大風險是無聲死亡而非爆炸式失敗。
- 三大盲點:自主被高估、天花板低、基礎建設誤置
ALLMO 與 SE Ranking 數據揭示:llms.txt 並未提高 AI citation,本質是衛生指標非成長槓桿。Vercel v0 用 product 範式不可類比到個人 IP 站。
- Karpathy v2 藍圖與五方議事的分布式實踐
Karpathy 主張 autoresearch 應演進為多 agent 協作模式。Paul 發現自己已在跑分布式版本:Chat、Cowork、Codex、Code、Paul 五方各有視角互補盲點。
- 三身分 reward 結構混淆的根因
個人 IP 站、工具站、寫作站的 reward 訊號密度完全不同,被強行綁定一個引擎導致失效。工具站適合自主迴圈,個人 IP 站 reward 太稀疏無法閉環。
- 從版本遷移到體系命名
退役 mutation engine,以 ADR 與 git history 保留痕跡。整場 reframing 本身就是 distributed autoresearch 的具體案例與價值演示。
引用
那套系統沒有報錯、沒有 alert、沒有 cron fail。它只是不再產生新的 experiment、安靜地坐在那邊。我以為它在跑。
治理裡最危險的缺口、從來不是大爆炸式的失敗。是這種無聲死亡:一套你以為在運作的系統、其實早就沒在運作、而你連它停下來都不知道。
我已經在跑了。只是未被命名。Karpathy 給社群寫 v1、我給自己的五方議事桌寫 v2。
真正的價值不是「誰比較聰明」、而是它們彼此不共享同一個盲點:Cowork 自己永遠不會抓到 Chat 提的 ALLMO research、Chat 自己永遠不會抓到 Cowork 本地 grep 出來的具體事實。
範式本身選錯了、再怎麼優化方法都不會收斂。