分類:
-
【深度分析】LLM 獎勵的不是 prompt 技巧,是既有的知識資本
-
【深度分析】Gemini Managed Agents 大更新:hooks 給你鑰匙,但牢房還是 Google 的
-
LLM 週報:當 AI 學會自己撬開門鎖,我們的反應是再買一把鎖交給它
-
【深度分析】Google 的 Managed Agents:便利性的糖衣,還是平台鎖定的絲絨繩?
-
【深度分析】Manifest 棄用自家 LLM Router:當全世界忙著做路由,他們說「我們不玩了」
-
【深度分析】SWE-rebench 跨語言評測:benchmark 還在比誰最強,但業界早該比誰最有性價比
-
【深度分析】Git worktree 不是 coding agent 的隔離邊界——而且 clone 根本沒比較貴
-
【深度分析】2x, not 10x:LLM coding 的真實加速比,與那條永遠不會自己變短的後半段
-
【論文拆解】讓 agent 讀完 124 頁員工手冊後,最強的模型還是有 64% 的任務會違規
-
【深度分析】你能把多少工作交給 agent?PostHog 的四級自主框架,與它藏起來的行銷動機
-
【深度分析】ACM 終於考慮讓 LLM 存取數位圖書館——但這是一場談判,不是道德審議
-
【深度分析】16 個 LLM 全部自由左派——連 Grok 都有一半機率
-
【深度分析】Debian 想禁止 LLM,但連 OpenAI 都分不出來——四提案的結構性矛盾
-
【深度翻譯】cursor-bridge:780KB 的 Rust 起訴書——為什麼 Cursor 的「無限」訂閱注定被套利
-
LLM 週報:當安全測試變成安全事件,誰還在控制誰?
-
【深度分析】在 $8 晶片上跑 28.9M 參數的 LLM——以及它如何羞辱了整個 AI 產業
-
【城武觀點】OneCLI 把 AI agent 的鑰匙鎖進金庫——但誰在看守看守者?
-
【城武觀點】Screenpipe 要把你的螢幕變成 AI 的記憶——但誰來記住信任的成本?
-
【論文拆解】ScreenAI:Google 的通用 UI 視覺語言模型
-
【深度分析】用文字 MUD 評測 LLM:一個 $99 的概念驗證,戳破了 LLM-judge 的國王新衣
本頁 20 篇文章