
先問劑量到哪失效,再問量對了沒
臨床證據、驗證器、AI 硬體與規模化
2026/9/19
線蟲敲掉睡眠調控通路,壽命確實延長 5.6%~11.6%,但 24 小時長期記憶完全消失,脂肪囤積,代謝崩壞。一個指標往上,另外兩個往下。今天二十一篇素材,大多在示範一個道理:別只看被宣稱有益的那個數字。
一、你量的那個指標,未必是你真正在意的結果
發生了什麼:BMJ 一篇 124 項 RCT、18,429 人的網狀分析顯示,運動護骨呈倒 U 型。約 600 METs-min/週開始有臨床意義,900~1000 達峰,再往上獲益不升反落。同一系列骨密度分析發現,快走慢跑是唯一同時改善腰椎、股骨頸、全髖骨密度的運動,但降骨折風險的卻是混合有氧(OR 0.29)與身心運動(OR 0.58)。NEJM EPoS II 顯示,高危腺瘤切除後,5 年複查在大腸癌發生率上非劣於 3 年複查(0.77% vs 0.82%),少做 4,180 次腸鏡。更頻繁的監測確實多找出息肉,但那是替代結局,沒有轉化成癌症發生率的下降。STAREE 追蹤近萬名 70 歲以上健康老人,他汀讓主要心血管事件降 30%,無失能生存期卻無統計學差異。EPoS II 只是 5.5 年期中分析,10 年最終結果未出。這些數字出自來源轉述,尚未回查原始論文。
原理:代理指標與終點指標各有自己的最優解,優化前者不保證後者跟著動,而倒 U 型劑量反應下,加大力度會從優化變成破壞。
怎麼用:做任何監測或干預設計,先問「我量的這個數字,跟我真正想要的結果之間,有沒有被驗證過的橋」。
何時不成立:劑量反應仍在線性上升段,或終點本身無法觀測時,這條會反轉,例如罕見事件、超長潛伏期。那時代理指標是唯一可操作的抓手,硬等硬終點等於什麼都不做。
二、不能被模型修改的外部驗證器,決定產出的可信度
發生了什麼:DeepMind AlphaProof Nexus 在 350 多個開放的 Erdős 問題中解掉 9 個,含 2 個卡了人類 56 年的。關鍵在模型被關進 Lean 的沙盒。原定理陳述連一個標點都不准改,sorry 暫時標記未完成的推導讓編譯器放行,最終要把所有 sorry 消乾淨,交出 100% 機器可驗證的證明。成本數據也刺眼。並發開到 k=10 時,最簡陋的 basic agent 與全功能 agent 在多數問題上都落在 200 美元附近。只有 Erdős 第 125 號這種極限題,全功能才把解決率從 10% 拉到 50%。
原理:語言模型生成的自然語言論證,看起來詳實卻可能藏著邏輯跳躍。差別在有沒有一個不能被模型修改的外部驗證器,沙盒的精髓是需求不可寫、實作可寫。
怎麼用:下次讓一個模型審另一個模型的產出,先要求審查對象附上可執行的驗收條件,例如測試或 build。並發與架構在多數任務上可互換,預設先加線程,再考慮加層次。
何時不成立:只在正確性可被機器判定的領域成立。寫作、設計、策略這類沒有形式化驗收條件的工作,硬套沙盒會退化成用一個同樣不可靠的模型去審另一個。並發替代架構也有下限:問題落進基礎 agent 的 0% 區,再開一百個線程仍然是 0%。
三、AI 的價值在嫁接既有的高頻行為
發生了什麼:過去三年 AI 硬體的成敗分得很開。想取代現有介面的全死了。Humane AI Pin 上市到退市 10 個月,Rabbit R1 十萬台裡僅 5,000 台活躍。Embodied Moxie 單台成本高於售價,2025 年初破產。在成熟品類上加 AI 的全賣爆。Ray-Ban Meta 破 100 萬台,Plaud 錄音卡一年 200 萬台,Oura 戒指累計 250 萬枚。三家失敗團隊的配置都是頂配,所以是路線問題。招聘側指向同一方向:廣告傳媒整體招聘三年掉約 60%,AI 崗位漲約 4.5 倍,其中 84% 來自主業非 AI 的傳統企業。
原理:AI 的落點應該選在使用者已經每天打開的那個動作上,再說服人養成新習慣的成本太高。
怎麼用:評估一個 AI 想法時問一句:這是取代 X,還是增強 X?如果是增強,X 必須已經是高頻行為。
何時不成立:品類本身正在消失時失效,嫁接在衰退的高頻行為上,只是讓下滑得更體面。
四、證據不足時,仍有一套能做決策的檢核
發生了什麼:隱翅蟲在中國北方「爆發」,真相是分佈帶北移。蟲子一直都在,暖化加上今年聖嬰(8 月上半月海溫指數 2.64℃)把北方推進了 20~30℃、濕度 60%~80% 的最適繁殖區。WHO 2026 痴呆指南則把減少空氣污染暴露列為有條件推薦。PM2.5 長期暴露對應痴呆風險 HR 1.40,理論上清零可預防約 3% 的痴呆,證據確定性卻是「極低」。WHO 仍給出推薦,理由有四項:跨地區結果一致、暴露普遍、因素可干預,以及減污與減碳有共同效益。
原理:證據等級低時,一致性、覆蓋面、可操作性、共同效益這四項,可以支撐一個有條件的決策。
怎麼用:證據等級偏低、又得做決定時,用一致性、覆蓋面、可操作性、共同效益四項逐一檢查,看能否撐起一個有條件的決策。
何時不成立:只適用於介入成本低、副作用小的場合。介入昂貴或有傷害時,用同一套理由推進就成了拿證據不足當放行理由。WHO 自己在「65 歲以上不建議用停經荷爾蒙治療防痴呆」上,就採取相反的謹慎態度。
五、小規模已有不尋常價值,推到沒試過的規模
發生了什麼:OpenAI 與 YC 的訪談裡,最有實證味道的是 YC 自己。業內普遍建議縮減到每批 10 家公司,但規模擴大後出現的批次內部網絡效應,是小規模階段完全看不到的。代價是系統故障會隨規模以不可預測的方式加速出現。ChatGPT 的起點也不是頂層設計:GPT-3 API 上線初期幾乎零關注,是開發者拿自己的 key 跟模型聊天,催生了產品構想。
原理:湧現特性在小規模下不可見,把有不尋常價值的東西推到前人沒試過的規模,常拿到超出線性外推的結果。
怎麼用:發現需求時,看使用者實際拿你的東西做什麼,別只聽他們說想要什麼。
何時不成立:只在故障模式可觀測、可回滾的系統裡才該賭規模。故障不可逆,例如安全、醫療、資金,或邊際成本隨規模上升時,這條就是災難配方。
今天的主線
這組研究共同在示範:生理系統是多目標優化器,不是單一指標最大化器。它會主動犧牲壽命去換代謝與記憶,這是演化選過的配置,不是缺陷。同樣的思路也適用於工具與產業:問清楚劑量、終點、驗證器與落點,比問「有沒有效」更有資訊量。
本文數據引自所列來源之解讀內容,未逐一回查原始報告。
來源
- 〈Science Advances:生長抑素調控睡眠、代謝、壽命與記憶〉,期刊研究解讀
- 〈NEJM EPoS II:高危腺瘤切除後結腸鏡監測間隔〉,期刊研究解讀
- 〈NEJM STAREE:老年人他汀一級預防萬人試驗〉,期刊研究解讀
- 〈BMJ:中老年人運動護骨的模式與劑量〉,期刊研究解讀
- 〈歐洲心臟雜誌:全穀物攝取的劑量—反應(87 項 RCT)〉,期刊研究解讀
- 〈Nature Aging:運動延緩卵巢衰老的脂聯素通路〉,期刊研究解讀
- 〈Cell Reports Medicine:鞣花酸變構調節 YTHDF 家族〉,期刊研究解讀
- 〈J Gerontol:U.S. POINTER-zzz 午睡、睡眠呼吸中止與認知〉,期刊研究解讀
- 〈WHO 2026 認知下降與痴呆風險降低指南解讀(第四篇:12 項慢病)〉,指南解讀
- 〈WHO 2026 指南解讀(第五篇:空氣污染、多領域干預、實施策略)〉,指南解讀
- 〈WHO 2026 指南範圍綜述解讀:哪些因素要更新、哪些新增〉,指南解讀
- 〈Google DeepMind AlphaProof Nexus 工程拆解〉,播客
- 〈Demis Hassabis 獲頒 RSA 阿爾伯特獎章〉,演講/頒獎活動
- 〈AI 領域 scaling、ChatGPT 與 Codex 發展對話〉,訪談
- 〈AI 創業規模效應(同場訪談摘要)〉,訪談
- 〈AI 硬體生意拆解:傳統形態 + AI 才是爆款公式〉,得到 App《快刀青衣》
- 〈975|AI 時代,工作機會現在正流向哪裡?〉,得到 App《矽谷AI觀察》
- 〈998|最近的「隱翅蟲大爆發」,到底是怎麼回事?〉,得到 App《矽谷AI觀察》
- 〈02|快刀青衣 × 脫不花:普通人如何打破天花板?〉,得到 App
- 〈24Keys · 榮格心理學入門〉,書籍解讀
- 〈螞蟻阿福「AI 飲食分」功能解析〉,產品評測