智能與秩序

Autoresearch 在個人 IP 場景的正確具身:不是讓網站自己懂機器,是讓 Agent 們一起懂我

文章 2026/07/05

摘要

Paul Kuo 實驗將 Karpathy autoresearch 框架具身到個人 IP 站台(paulkuo.tw),設計自動 mutation engine 讓網站檔案自我優化。七週後系統無聲失效,他透過 Chat、Cowork、Codex、Code 四個 session 的分布式議事發現核心問題:誤將 llms.txt 視為可追逐的成長槓桿(實際是衛生指標),將三個不同 reward 結構的身分(個人 IP 站、工具站、寫作站)強行綁定於同一引擎。重大 reframing 是:個人 IP 場景的正確具身不是完全自主系統,而是五方議事(Chat-Cowork-Codex-Code-Paul)的分布式 autoresearch v2,透過不同視角互補各自的盲點。整個思考過程本身成為案例。

重點

  • mutation engine 把尚未收斂的行業慣例誤當成核心訊號,llms.txt 是衛生指標非成長槓桿
  • 個人 IP 站 reward 訊號稀疏延遲,無法自動閉環,與 product 類型的 v0 範式不可比
  • 三身分 category confusion:個人 IP / 工具站 / 寫作站的 reward 結構差異導致七週靜默失效
  • 分布式 autoresearch v2 核心是五方議事桌各自獨立長處互補,而非單一自主代理
  • 範式正確後優化方法才有意義,選錯載體再好的方法也無法收斂

章節

  1. Autoresearch 的個人 IP 具身實驗

    Paul Kuo 實驗將 Karpathy autoresearch 套用到 paulkuo.tw 站台,設計 mutation engine 讓白名單檔自動優化,期望在三月內持續改進分數。

  2. 七週無聲失效與發現

    系統於三月中停擺,五月才被發現。experiments.json 變成 0 bytes,沒有 alert 機制,代表治理的最大風險是無聲死亡而非爆炸式失敗。

  3. 三大盲點:自主被高估、天花板低、基礎建設誤置

    ALLMO 與 SE Ranking 數據揭示:llms.txt 並未提高 AI citation,本質是衛生指標非成長槓桿。Vercel v0 用 product 範式不可類比到個人 IP 站。

  4. Karpathy v2 藍圖與五方議事的分布式實踐

    Karpathy 主張 autoresearch 應演進為多 agent 協作模式。Paul 發現自己已在跑分布式版本:Chat、Cowork、Codex、Code、Paul 五方各有視角互補盲點。

  5. 三身分 reward 結構混淆的根因

    個人 IP 站、工具站、寫作站的 reward 訊號密度完全不同,被強行綁定一個引擎導致失效。工具站適合自主迴圈,個人 IP 站 reward 太稀疏無法閉環。

  6. 從版本遷移到體系命名

    退役 mutation engine,以 ADR 與 git history 保留痕跡。整場 reframing 本身就是 distributed autoresearch 的具體案例與價值演示。

金句

那套系統沒有報錯、沒有 alert、沒有 cron fail。它只是不再產生新的 experiment、安靜地坐在那邊。我以為它在跑。
治理裡最危險的缺口、從來不是大爆炸式的失敗。是這種無聲死亡:一套你以為在運作的系統、其實早就沒在運作、而你連它停下來都不知道。
我已經在跑了。只是未被命名。Karpathy 給社群寫 v1、我給自己的五方議事桌寫 v2。
真正的價值不是「誰比較聰明」、而是它們彼此不共享同一個盲點:Cowork 自己永遠不會抓到 Chat 提的 ALLMO research、Chat 自己永遠不會抓到 Cowork 本地 grep 出來的具體事實。
範式本身選錯了、再怎麼優化方法都不會收斂。
探索碰撞 ↗
從這裡開始系列核心概念動態牆知識圖譜碰撞關於搜尋聯絡我
EN
字級