Intelligence & Order
AI Coding 的最后一道墙:我用10万 Star 开源知识图谱挑战真实软件系统
Summary
實測開源專案 Graphify(近 10 萬 GitHub star):用毫秒級、零 token 成本的 AST 靜態解析把程式碼庫轉成結構化知識圖譜,聲稱能讓 AI 查詢程式碼而非盲目搜索。作者用 9 道真實架構問題,比較純 Grep 搜索與掛載知識圖譜兩組在同一套量化情報系統代碼庫上的表現,發現在找文件、找調用鏈這類任務上兩組幾乎打平,圖譜真正的價值反而是幫助人類建立系統的整體認知,而非直接提升 AI 搜索能力;AST-only 的靜態圖譜也無法捕捉 Shell 到 Python 這類跨語言的隱性依賴關係。內容為簡體中文頻道轉寫,已正體化與用語校正。
Key points
- Graphify 用 Tree-sitter 引擎對 35 個檔案、近 18000 行程式碼在不到兩秒、零 token 成本下建出 280 個節點、283 條邊、35 個網路社群的知識圖譜,號稱 100% 從語法樹提取、無大模型幻覺
- 8 道基礎架構問題的對照實驗:帶圖譜組耗時 148 秒、消耗 36787 token;無圖譜的純 Grep 基線組耗時 142 秒、消耗 48494 token,圖譜省了約 24% token,但兩組給出的實質答案幾乎一致,某些題目基線組甚至找得更全
- 第 9 題變更影響分析(修改核心模組會牽連哪些外部檔案)才顯現差異:圖譜組整理出分層影響分析報告,但因為 Graphify 是純 AST 解析,無法建立 Shell 腳本呼叫 Python 檔案這種跨語言的隱性依賴邊,仍比基線組多花約三倍時間
- 核心反思:純文字搜索是讓 AI 找,知識圖譜的可視化是讓人類看;在找的維度上,現代大模型的全文檢索能力早已足夠,圖譜真正無可取代的價值在於幫助人類快速建立對陌生代碼庫的系統性認知
- 圖譜的視覺化功能自動用社群發現演算法把 280 個節點聚成 35 個彩色群落並自動命名,讓人類第一次以有機生命體的視角理解系統結構
- 結論:目前 AI Coding Agent 真正缺的不是找程式碼的能力,而是一個能模擬程式碼在運行時如何動態形變、跨檔案跨時間傳導風險的軟體世界模型,靜態語法樹圖譜終究只是一張高解析度的靜態 X 光片
Quotes
純文字搜索讓 AI 找,而這張圖是讓我看:找的時候 AI 是帶有目的性的,就像在黑暗的房間裡打著手電筒,光斑很亮,但你永遠看不見整個房間。
我們現在的 AI 缺知識嗎?不缺,他們看代碼比我們快一萬倍。AI Coding Agent 可能缺少的,是一個面向軟體系統的世界模型。