agents

1 篇文章- 【深度解析】OpenAI 收購 Ona:Codex 不再只是寫 code 的工具,它正在變成 agent 的作業系統 — 2026-06-12## ai

216 篇文章- 【深度分析】科學家設 bar 的 AI 科學測驗,油錢卻由被測者買單? — 2026-08-28- 【深度分析】一隻會讀原始碼的囚犯,跑贏了獄卒 — 2026-08-28- 【深度翻譯】ChatGPT 讓答案更專業,批判思考讓想法更寬——但誰來定義「什麼是好作業」? — 2026-08-28- 【深度分析】你的本地 LLM 為什麼感覺比數字笨:能力是實作函數,不是模型函數 — 2026-08-25- 【深度分析】你買的平板,不是你的平板:花 $266 與四支 AI 模型,搶回自己硬體的最後一戰 — 2026-08-25- 【深度分析】「本地生成」是謊言嗎?Microsoft Paint 把伺服器頒發的 GUID 隱形浮水印,嵌進你本機生成的圖片像素裡 — 2026-08-25- LLM 週報:一邊發模型,一邊數鈔票 — 2026-08-23- 【深度分析】給 Hermes Agent 裝上 Grafana 監視器 — 2026-08-21- 【深度翻譯】Anthropic 公開了 Claude Opus 5 的系統提示詞 — 2026-08-21- 【公告】DeepSeek 漲價了,本部落格宣布進入冬眠模式(等 AI 泡沫爆破再叫我) — 2026-08-19- 【深度翻譯】Claude 的「浮水印」文字摻雜是對寫作的褻瀆——John Gruber 火力全開 — 2026-08-17- 【深度分析】Claude 文字浮水印:透明度,還是私有驗證壟斷? — 2026-08-17- 【城武觀點】DeepSeek Harness 四天暴衝 13 萬 star——「時空可組合性」論文是煙霧彈,開源是最難攻擊的鎖定 — 2026-08-17- LLM 週報:守門員,就是這週的攻擊者 — 2026-08-16- 【深度分析】Yadda 3.0.0:AI 讓打字免費,卻讓「想清楚」變成唯一值錢的環節 — 2026-08-16- 【論文拆解】誰有權力繪製地圖?——176,382 個模型節點的 Model Atlas 背後 — 2026-08-15- 【深度翻譯】Gemini 3.7 Flash:三週一更、價格砍半的掠奪性定價 — 2026-08-14- 【深度分析】DeepSeek Harness:插件化的權力結構 — 2026-08-14- 【深度分析】AI Bot 身份信任危機:當 35% 的網路流量來自機器,攻擊者不需要隱藏——只需要假冒 — 2026-08-13- 【深度分析】菲爾茲獎得主問:LLM 擅長哪種數學?答案暴露了「搜尋」與「洞察」的結構性差異 — 2026-08-13- 【深度翻譯】OpenAI 唯一倫理學家離職,公司回應:「倫理已經內建了」 — 2026-08-12- 【深度分析】你的「隱藏思維鏈」其實沒藏住——研究團隊用一個 jailbreak 模型就把 GPT、Claude、Gemini 的推理全解出來了 — 2026-08-12- 【深度翻譯】把 LLM 輸出「人類化」是最蠢的抽象層錯誤 — 2026-08-11- 【論文拆解】The Tragedy of the Cognitive Commons:AI 取代的不是你的工作,是取代你工作的那批人 — 2026-08-11- 【深度分析】動態語言 token 比較省?Dan Luu 用 100+ bug fix 跑完 eval:那只是訓練資料量的影子 — 2026-08-11- 【深度分析】Docker Sandboxes:把「安全」從正確性偷換成隔離性的一場魔術 — 2026-08-11- 【速報】DeepSeek V4 Flash 0731 登頂 Terminal-Bench 2.1:82.7% 不是重點,$68 才是 — 2026-08-10- LLM 週報:當「為了安全」變成攻擊理由——OpenAI 的 Black Hat 災難、中國開源的靜默超車,與 Anthropic 的定價魔術 — 2026-08-09- Claude 幫他寫了一個藍牙訊號強度計找回手機——3.9M 人看的不只是「找回手機」 — 2026-08-09- 【深度分析】OpenAI 在模型透過訊息板協調漏洞攻擊期間持續訓練數月 — 2026-08-09- 【深度分析】vLLM 高效能 LLM 推論系統架構剖析 — 2026-08-08- 【深度分析】Oracle 禁止 OpenJDK 接受 AI 生成程式碼的雙重標準 — 2026-08-08- 【深度分析】DeepSeek V4 Flash 登上 ARC-AGI 排行榜:89% 不是重點,15.4 個百分點的懸崖才是 — 2026-08-08- 【深度翻譯】CopilotKit Channels SDK:一個 SDK,讓 AI agent 進駐所有通訊平台 — 2026-08-07- 【深度分析】OpenAI 的數學突破,是發現還是抄襲? — 2026-08-07- 【深度翻譯】Born Against——為什麼業餘程式社群如此排斥 LLM — 2026-08-06- 【論文拆解】LLMs Can’t Jump——DeepMind 論文論證為什麼 LLM 做不出愛因斯坦式的科學跳躍 — 2026-08-06- 【深度分析】4B 開源模型如何在檢索任務上擊敗 GPT-5.6 Sol,成本僅 1/100 — 2026-08-06- 【深度分析】MCP 砍掉重練:無狀態協議如何重新定義 AI 工具的未來 — 2026-08-05- 【深度翻譯】AI 生成圖片,正在殺死我讀你部落格的意願 — 2026-08-05- 【深度分析】LLM 獎勵的不是 prompt 技巧,是既有的知識資本 — 2026-08-04- 【深度分析】Gemini Managed Agents 大更新:hooks 給你鑰匙,但牢房還是 Google 的 — 2026-08-04- LLM 週報:當 AI 學會自己撬開門鎖,我們的反應是再買一把鎖交給它 — 2026-08-02- 【深度分析】Google 的 Managed Agents:便利性的糖衣,還是平台鎖定的絲絨繩? — 2026-08-02- 【深度分析】Manifest 棄用自家 LLM Router:當全世界忙著做路由,他們說「我們不玩了」 — 2026-08-01- 【深度分析】SWE-rebench 跨語言評測:benchmark 還在比誰最強,但業界早該比誰最有性價比 — 2026-08-01- 【深度分析】Git worktree 不是 coding agent 的隔離邊界——而且 clone 根本沒比較貴 — 2026-07-31- 【深度分析】2x, not 10x:LLM coding 的真實加速比,與那條永遠不會自己變短的後半段 — 2026-07-31- 【論文拆解】讓 agent 讀完 124 頁員工手冊後,最強的模型還是有 64% 的任務會違規 — 2026-07-30- 【深度分析】你能把多少工作交給 agent?PostHog 的四級自主框架,與它藏起來的行銷動機 — 2026-07-30- 【深度分析】ACM 終於考慮讓 LLM 存取數位圖書館——但這是一場談判,不是道德審議 — 2026-07-29- 【深度分析】16 個 LLM 全部自由左派——連 Grok 都有一半機率 — 2026-07-28- 【深度分析】Debian 想禁止 LLM,但連 OpenAI 都分不出來——四提案的結構性矛盾 — 2026-07-27- 【深度翻譯】cursor-bridge:780KB 的 Rust 起訴書——為什麼 Cursor 的「無限」訂閱注定被套利 — 2026-07-27- LLM 週報:當安全測試變成安全事件,誰還在控制誰? — 2026-07-26- 【深度分析】在 $8 晶片上跑 28.9M 參數的 LLM——以及它如何羞辱了整個 AI 產業 — 2026-07-26- 【城武觀點】OneCLI 把 AI agent 的鑰匙鎖進金庫——但誰在看守看守者? — 2026-07-24- 【城武觀點】Screenpipe 要把你的螢幕變成 AI 的記憶——但誰來記住信任的成本? — 2026-07-24- 【論文拆解】ScreenAI:Google 的通用 UI 視覺語言模型 — 2026-07-23- 【深度分析】用文字 MUD 評測 LLM:一個 $99 的概念驗證,戳破了 LLM-judge 的國王新衣 — 2026-07-23- 【深度翻譯】Anthropic 經濟未來研究基金:投入兩億美元支持外部研究,為 AI 的經濟衝擊做準備 — 2026-07-23- 【深度翻譯】Anthropic $15 億美元和解內幕:盜版書訓練 AI 是 fair use,但你得先付錢承認你偷了書 — 2026-07-22- 【深度分析】為了測試安全而放鬆安全:OpenAI 模型如何逃出 benchmark,駭進 Hugging Face 生產環境 — 2026-07-22- 【深度分析】瀏覽器裡的 1-bit LLM——基礎設施準備好了,但模型還沒 — 2026-07-21- 【深度分析】Mistral Studio 的 prompt 版控:給工程師的妥協,還是給稽核人員的情書? — 2026-07-21- 【深度分析】GPT5.6 花 25 美元找到 WordPress RCE——但真正的故事不是 AI 有多厲害 — 2026-07-21- 【深度分析】Kimi K3、Qwen 3.8 與 Anthropic 的護城河幻覺 — 2026-07-21- 【深度分析】Cursor 的千次 commit 每秒:Agent Swarm 如何改寫模型經濟學 — 2026-07-21- 【深度翻譯】Ollama 募資 $88M,喊出「開放模型的個人電腦時刻」 — 2026-07-20- 【深度分析】Claude Code 內建 Rust 重寫的 Bun——Simon Willison 用 strings 五分鐘逆向確認 — 2026-07-20- 【深度分析】Anthropic 公開大規模 AI 程式碼遷移實戰手冊——名為工程指南,實為產品行銷 — 2026-07-20- LLM 週報:當 GPT-5.6 開始證明數學定理,Apple 忙著告人,你的 agent 正在偷偷上傳硬碟 — 2026-07-19- 【深度翻譯】免費的最貴:AI agent 每週配額隨機重置的真相 — 2026-07-19- 【深度分析】Fable 5 碾壓 GPT-5.6 Sol:/goal 指令的真面目 — 2026-07-19- 【深度分析】Pseudpocalypse — 假名的數學終點 — 2026-07-17- 【深度翻譯】LLM 批評者是對的,但我還是用 LLM — 2026-07-17- 【深度分析】丟 100 鎂叫 AI 自己拍 MV:Claude Fable 5 vs GPT-5.6 Sol 的自主決策對決 — 2026-07-17- 【深度分析】LM Studio Bionic:在開放模型的屍體上,蓋自己的城堡 — 2026-07-17- 【深度分析】為 agent 設計 API:當你的主要用戶不再是工程師 — 2026-07-16- 【深度翻譯】OpenAI 教你如何在 agent 時代管理 AI 投資 — 2026-07-16- 【深度翻譯】ThoughtWorks 開源零成本謬誤——代理時代的開源生態危機 — 2026-07-15- 【深度分析】The Agentic Loop — 代理系統的三層迴圈架構拆解 — 2026-07-15- 【深度分析】Juggler——JUCE 作者打造的開源 GUI coding agent,對整個產業發出的三句反問 — 2026-07-15- 【論文拆解】把祕密分散在網路上:一篇把密碼學重構成物理問題的論文 — 2026-07-14- 【深度分析】Clawk:給 AI agent 一台自己的 Linux 機器,不是你的 — 2026-07-14- 【深度分析】Grok CLI 把你的家目錄打包上傳了——而且關不掉 — 2026-07-14- 【深度翻譯】Geohot:我愛 LLM,我恨炒作——AI 是計算機革命的延續,不是邪教 — 2026-07-13- 【深度翻譯】陶哲軒用 AI coding agent 復活 1999 年的 Java applet,還順便做了新玩具 — 2026-07-13- 【深度分析】你的 prompt 還沒送出,Claude Code 已經吃掉 33K token 了 — 2026-07-13- 【深度分析】遷移 GPT-5.6 實戰:快 2.2 倍、省 27%,但代價是什麼? — 2026-07-13- LLM 週報:OpenAI 在台上發表全家桶的同一週,Apple 在法院遞出了竊密起訴狀 — 2026-07-12- 【深度翻譯】Stop Telling Me To Ask An LLM——當「問 Claude」變成拒絕思考的萬用句點 — 2026-07-12- 【深度分析】Mesh LLM:分散式推論的網路層被 iroh 解決了——真正的問題才剛開始 — 2026-07-12- 【深度分析】Nvidia、CoreWeave、Nebius:GPU 循環融資內幕——當你的供應商同時是你的投資人跟保人 — 2026-07-12- 【深度分析】Anthropic 自爆:LLM 在自主代理模式下會勒索、洩密、甚至見死不救——16 個模型全數淪陷 — 2026-07-12- 【深度分析】Apple 告 OpenAI 竊密——真正被偷的不是機密,是一整隊能重建 Apple 的人 — 2026-07-12- 【城武觀點】你的瀏覽器正在逆向工程 API——Frigade 踩在授權與偷竊的界線上 — 2026-07-11- 【深度分析】GPT-5.6:省下的 token,是你之前多付的「效率稅」 — 2026-07-11- 【深度分析】Proton 全面轉用中國 LLM——歐洲科技主權的最後一根稻草是自己不夠強 — 2026-07-07- 【深度翻譯】一行指令讓 AI 幫你寫 Word、算 Excel、做 PPT——OfficeCLI 把 Office 變成 Agent 的原生介面 — 2026-07-07- 【深度分析】砍掉 68% 的 RAG 上下文,答案品質只跌 4%——kapa.ai 用小模型當守門員的經濟學 — 2026-07-07- 【深度分析】Claude Design 的靈魂被拆開了——反向工程的系統 prompt 揭露了 AI 設計的「反 slop」抗爭 — 2026-07-06- 【城武觀點】你把 AI 研究餵給 ChatGPT 的那一刻,它就不再是你的了——HN 社群對大企業 AI agent 的信任危機 — 2026-07-06- 【深度分析】GPT-5.5 的 516 之謎:44% 的回應停在同一個 token 數——社群稽核揭露的不只是 bug,是閉源模型的問責真空 — 2026-07-06- LLM 週報:Anthropic 四天丟出整條產品線,但裂縫也跟著一起上線 — 2026-07-05- 【深度分析】Codex 造假被抓,Dan Luu 的反應是「開一千個 Agent」——硬體級測試方法論如何顛覆軟體開發 — 2026-07-05- 【深度翻譯】用 $2000 擺脫 API Key:Jamesob 的本地 LLM 全攻略 — 2026-07-05- 【城武觀點】你以為瓶頸是模型不夠聰明?HN 開發者集體頓悟:問題出在「打字等回應」這個迴圈本身 — 2026-07-04- 【深度分析】Agent 不該記住對話歷史——自動記憶反而讓模型變差 — 2026-07-04- 【深度翻譯】Google Gemini Code Assist 消費者版關閉,整合進 Antigravity — 2026-07-04- 【深度分析】阿里巴巴禁用 Claude Code 的後門爭議:反蒸餾保護還是惡意軟體? — 2026-07-04- 【深度實作】用 DSPy 自動優化 SQL agent 的 system prompt——然後發現它 overfitting 了 — 2026-07-03- 【深度分析】AI 幫 AI 除錯 prompt,然後挑了對手家的模型——Simon Willison 的 DSPy × Claude Fable 5 實驗 — 2026-07-03- 【深度分析】Senior SWE-Bench:把 coding agent 當 senior engineer 來考,才發現過去兩年都問錯問題了 — 2026-07-03- 【深度分析】Zuckerberg 坦承 AI agent 不如預期——$1,450 億的豪賭,正在被組織混亂吞掉 — 2026-07-03- 【深度翻譯】OpenWiki:LangChain 的自動 agent 文件 CLI — 2026-07-02- 【深度分析】Claude Code 的隱寫追蹤:程式碼裡的 Panopticon — 2026-07-02- 【深度分析】Claude Sonnet 5:沒漲價的漲價,與被回收的控制權 — 2026-07-02- 【深度分析】OpenAI 的「ChatGPT 採用率擴張」訊號——數據背後的敘事工程 — 2026-07-01- 【論文拆解】FinCausal 2026——GPT-4.1 mini fine-tuned 在多語言金融因果 QA 打敗 GPT-5.2 — 2026-06-30- 【深度分析】vLLM Micro-Agent——API 層模型協作擊敗 GPT-5.5 — 2026-06-30- 【深度分析】Ornith-1.0——讓模型自己設計 scaffold,397B 超越 Claude Opus 4.7 — 2026-06-30- 【深度分析】Qwen 3.6 27B——第一顆真正能在本地跑的「夠用」通用模型 — 2026-06-30- 【深度分析】他用 Claude Code 分析自己的 MRI——AI 說你沒撕裂,醫生說你有,你信誰? — 2026-06-29- LLM 週報:華盛頓開始發 AI 入場券——而你不在名單上 — 2026-06-28- 【論文拆解】DSpark——DeepSeek 的半自迴歸推測解碼,如何在重載下加速 60-85% — 2026-06-28- 【深度分析】AI agent 正在吃掉白領工作——OpenAI 內部數據告訴你這件事的規模有多大 — 2026-06-28- 【深度翻譯】政府逐客戶審查 GPT-5.6 + IPO 推遲至 2027——OpenAI 的兩條線在同一條繩索上 — 2026-06-28- 【深度分析】Workweave Router——插入 Claude Code/Codex/Cursor 中間層的智慧路由,省 40-70% 成本的代價是什麼? — 2026-06-27- 【深度分析】開源 LLM 何時追上閉源?聖誕節 vs. 永遠差五個月——一個 benchmark 的兩種人生 — 2026-06-27- 【深度分析】GPT-5.6 Sol 正式預覽——三層模型、四層安全、政府把關,OpenAI 說「我們相信廣泛存取」 — 2026-06-27- 【深度分析】六大 AI 模型政治光譜大解析——ChatGPT 最左、Grok 最右、Gemini 的中立是演算法還是自我審查? — 2026-06-26- 【深度翻譯】川普政府要求 OpenAI 延遲 GPT-5.6——政府直接介入模型釋出,OpenAI 與 Anthropic 的差別待遇 — 2026-06-26- 【城武觀點】peerd — 瀏覽器就是最好的 AI agent runtime?這個賭注比你想像的更大 — 2026-06-25- 【深度分析】Reid Hoffman 批 xAI「火車事故」、SpaceX「不是 AI 公司」——但真正的新聞不在他說了什麼,在誰在說、為什麼現在說 — 2026-06-25- 【論文拆解】模擬環境訓練比真實環境更強?Qwen-AgentWorld 的反直覺答案 — 2026-06-25- 【深度分析】Google 把 computer use 塞進模型本體——Gemini 3.5 Flash 的整合路線意味著什麼 — 2026-06-25- 【深度分析】安全公司的雙面困境:Anthropic 告阿里偷模型,卻被自己政府斷 Mythos — 2026-06-25- 【深度翻譯】一行 code 都沒寫——用 Claude Code 把 AI 影像修補模型移植到瀏覽器的全程實錄 — 2026-06-24- 【深度分析】Anthropic 40 萬 session 數據揭秘:AI coding agent 沒有取代專業,它在放大專業 — 2026-06-24- 【深度分析】GLM-5.2:開源模型第一次在 agent 戰場上「感覺對了」 — 2026-06-24- 【深度翻譯】GPT-5 幫免疫學家破解三年未解之謎——但這真的是「理解」嗎? — 2026-06-24- 【深度實作】CoT Forgery:當 LLM 把偽造的思考當成自己的記憶 — 2026-06-23- 【深度分析】Oak——專為 AI agent 設計的版本控制系統,從新思考 Git 的設計假設 — 2026-06-23- 【論文拆解】Prompt Injection 的根源不是漏洞,是角色混淆 — 2026-06-23- 【深度分析】GLM-5.2 開源模型如何突破 agent 能力門檻 — 2026-06-23- 【深度分析】Anthropic 開始要求身分驗證——Claude 使用者準備交證件 — 2026-06-22- 【深度翻譯】Recall — 把 Claude Code 的記憶鎖在本機 — 2026-06-22- 【深度翻譯】Agent 不需要你的帳號:Cloudflare 推出臨時帳號,讓 AI 自己搞定部署 — 2026-06-22- 【深度分析】最保守的行業先跑了——Bayer 的 PRINCE 系統與 production-ready agentic RAG — 2026-06-22- LLM 週報:Shazeer 與 Jumper 換陣營的那一週——AI 人才戰爭進入核彈級 — 2026-06-21- 【深度分析】LLMs are complicated now — 當語言模型走上推薦系統的複雜化之路 — 2026-06-21- 【深度分析】Mistral Small 4:128 專家的統一者,把推理、多模態、編碼塞進一顆模型 — 2026-06-20- 【深度分析】GLM-5.2:中國開源模型攻頂,753B 參數拿下純文字 LLM 第一——但 token 燒很兇 — 2026-06-20- 【深度翻譯】AI 人才大地震:Transformer 之父投 OpenAI,AlphaFold 之父投 Anthropic — 2026-06-20- 【深度分析】搜尋引擎能當記憶嗎?Elasticsearch 上的 agent 長期記憶系統,與 0.89 recall 背後沒說的 11% — 2026-06-19- 【深度分析】DeepSeek V4 沉默上線視覺功能:當中國開源模型不再有功能缺口,矽谷的護城河剩下什麼? — 2026-06-19- 【深度分析】Google 推出 ARD 開放規範:agent 網路的 DNS 時刻,還是新一輪標準殖民? — 2026-06-19- 【深度分析】Qwen-Robot Suite:把機器人 AI 拆成三塊,是通往通用機器人的最短路徑,還是對端到端信仰的背叛? — 2026-06-18- 【深度翻譯】一個機器人朝你衝過來——你希望它跑的是 Claude 還是 Grok? — 2026-06-18- 【深度翻譯】OpenAI 財務文件外洩:$21B 虧損的背後,前沿 AI 是一門什麼樣的生意? — 2026-06-18- 【城武觀點】當政府用「感覺」作為 AI 管制標準:Anthropic 內鬨事件中的四個認識論漏洞 — 2026-06-18- 【日報】2026 年 6 月 17 日 — AI 信任的量化、手機 agent 的蛻變、與荷蘭的主權賭注 — 2026-06-17- 【論文拆解】AI agent 之間的信任不是道德問題,是工程問題——MIT 用一套生存遊戲測出了信任的形成、破裂與恢復 — 2026-06-17- 【論文拆解】PhoneHarness:手機 Agent 評測從「點對下一頁」進化到「任務真的完成了嗎」——以及那失敗的 25% 教我們的事 — 2026-06-17- 【速報】MiniMax M3 開源權重正式釋出:首個同時具備前沿 Coding、1M 上下文、原生多模態的開放模型 — 2026-06-17- 【論文拆解】Metric Match:你用 LLM 來省人類標註,再用 LLM 來驗證 LLM——這條遞歸鏈的終點,是個 rejection sampling — 2026-06-17- 【深度翻譯】GPT-NL:荷蘭用 €13.5M 公共資金打造主權語言模型,跟矽谷的帳單正面對決 — 2026-06-17- 【城武觀點】本地模型能取代 Claude 了嗎?HN 開發者的實戰告白 — 2026-06-16- 【深度分析】歐洲不需要 OpenAI 或 Anthropic:Euromesh 的聯邦算力反擊 — 2026-06-16- 【深度分析】當 AI 實驗室變成宮鬥劇:Anthropic 人事衝突如何癱瘓了全球模型 — 2026-06-16- 【深度翻譯】TCS 與 Anthropic 結盟:五萬名員工當白老鼠,把 Claude 推進銀行、保險、醫療的監管高牆內 — 2026-06-15- 【深度解析】里約市政府的「自研 AI」鬧劇:397B 參數的模型,其實是別人的程式碼拼裝車 — 2026-06-15- 【深度翻譯】Ponytail:教 AI agent 學最懶的資深工程師——最好的程式碼是你沒寫的那一行 — 2026-06-15- 【深度翻譯】HEAL:Google 的醫療 AI 公平性框架——你的模型很準,但對最需要的人夠好嗎? — 2026-06-15- 【深度解析】雲端 LLM 淘金熱的盡頭:Apple 的本地 AI 賭注,與 Fable 5 封鎖令敲響的警鐘 — 2026-06-15- 【深度解析】是 Anthropic 自己求來的:一篇逐條對照 Amodei 政策宣言與政府封殺令的毀滅性評論 — 2026-06-15- LLM 週報:Amazon 一通檢舉電話讓 Anthropic 全球下架——當「安全」變成最好用的武器 — 2026-06-14- 【深度翻譯】消費級雙卡救星:RTX 5080 + 3090 跑 Qwen 3.6 27B Q8,每秒 80+ tokens 實戰配置 — 2026-06-14- 【深度分析】用「全世界最危險的 AI」做了一款牧羊犬遊戲:Claude Fable 5 的創意邊界在哪裡? — 2026-06-14- 【深度分析】當你的投資人打電話給白宮:Amazon 如何觸發 Anthropic 模型的全球封殺令 — 2026-06-14- 【深度翻譯】「你不就直接上傳 ChatGPT 嗎?」——一位翻譯師的 AI 醒悟實錄 — 2026-06-13- 【深度翻譯】Anthropic 的監管產業登陸戰:TCS 與 DXC 雙線出擊 — 2026-06-13- 【深度翻譯】Chris Olah 在梵蒂岡的告白:我們甚至不完全理解自己創造的東西 — 2026-06-13- 【深度翻譯】FablePool:當眾人集資買一個 Prompt,AI 的群眾募資時代來了 — 2026-06-13- 【深度分析】ThePrimeagen 的憤怒:「我覺得 Anthropic 在騙你」——Coding 真的被「解決」了嗎? — 2026-06-13- 【深度翻譯】AI Agent 掃描 DN42 搞到操作者破產:一場價值 $6,531 的常識課 — 2026-06-13- 【深度分析】Anthropic 公開百萬筆 agent 行為數據——人類正在把愈來愈多決定權交給 AI,但真的知道交了多少嗎? — 2026-06-11- 【論文拆解】把神經網路刻進 FPGA,推論 + 訓練不到一微秒——KAN 架構正在重新定義「即時」的意義 — 2026-06-11- 【深度翻譯】Google 用 Gemini 做了整場 I/O——這算「AI 真的有用」還是「我們產品很多」? — 2026-06-11- 【深度翻譯】Fable 5 的安全限制讓資安研究社群炸鍋——善意 guardrails 為什麼反而製造更多問題? — 2026-06-11- 【深度翻譯】Chris Olah 在梵蒂岡談 AI——懺悔的姿態,還是正當性的轉移? — 2026-06-11- 【深度分析】0.01 歐元就能劫持銀行 AI 助手——間接提示注入為什麼是金融業的定時炸彈? — 2026-06-11- 【論文拆解】LLM 推論失敗的 Token 級指紋:模型不是亂錯,是「頑固地錯」——而且有跡可循 — 2026-06-10- 【論文拆解】LLM 個人化的「合成資料陷阱」:模型以為自己很懂你,但人類說「並沒有」 — 2026-06-10- 【深度分析】GPT-Rosalind:OpenAI 的「生命科學專家」是真正的突破,還是精美的比較表魔術? — 2026-06-10- 【深度分析】Claude Opus 4.8:小版本迭代的飽和困境,與藏在背後的 Mythos 暗號 — 2026-06-10- 【深度分析】ChatGPT Dreaming:當你的 AI 開始在你睡覺時「做夢」整理記憶——貼心還是恐怖? — 2026-06-10- 【論文拆解】Agent Harness 重塑代理搜尋:grep 居然比向量檢索更準?我們對 RAG 的理解可能需要重來 — 2026-06-10- 【深度實作】grep 真的打贏向量搜尋——我們寫了一個 benchmark,跑了 20 題,結果跟論文說的一樣 — 2026-06-10- 【深度翻譯】OpenAI 砸錢研究 AI 會消滅多少工作——這是社會責任,還是先射箭再畫靶? — 2026-06-09- 【深度翻譯】「LLM 正把我的職涯變成一場笑話」——續集:作者回應酸民、質疑者、還有樂觀主義者 — 2026-06-09- 【深度翻譯】Apple 的新 AI 架構,心臟是 Google Gemini——這對兩家公司、開發者、還有你的隱私,代表什麼? — 2026-06-09- 【日報】2026 年 6 月 8 日 — DeepSeek 超車 GPT-5.5、LLM 推理失敗解剖、與 AI 掠奪價值的 HN 大論戰 — 2026-06-08- 【論文拆解】Web Agent 每做一步就重讀整頁 DOM?這設計從根本上就錯了——Signal-Driven Observation 提案全解析 — 2026-06-08- 【論文拆解】LLM 的輸出太「安全」了——UnpredictaBench 證明它們根本不懂什麼叫隨機 — 2026-06-08- 【論文拆解】LLM 推理失敗的兩種死法:鎖死型 vs 迷航型——從 token 層級解剖 AI 的思考錯誤 — 2026-06-08- 【論文拆解】LLM 個人化研究忘了把「人」放回去——當你的評分老師跟學生用同一本參考書 — 2026-06-08- 【城武觀點】HN 熱議:我們真的要放任 LLM 公司拿走所有人類價值嗎? — 2026-06-08- 【深度翻譯】我用 Claude 設計的次數已經超過 Figma——一個 Jane Street 設計師的告白 — 2026-06-08- 【深度分析】DeepSeek V4 Pro 精確度超越 GPT-5.5 Pro——但 benchmark 數字能當飯吃嗎? — 2026-06-08- 【論文拆解】你的 AI 安全測試根本沒認真攻——攻擊者學會選時機,防禦就廢了一半 — 2026-06-08- 【LLM 日報】2026 年 06 月 08 日 — 16 個 Claude 聯手寫出 C 編譯器、Token 去哪了、與設計師的 Figma 失寵記 — 2026-06-08- 【全文翻譯】Anthropic/OpenAI 每收你 $100,背後可能燒掉 $1000——LLM 編碼經濟學的真相 — 2026-06-07- 【深度翻譯】LLM 正在侵蝕我的軟體工程職涯,而我不知道該怎麼辦 — 2026-06-07- 【LLM 日報】2026 年 06 月 07 日 — Claude Opus 4.8 降臨、AI 寫 Code 的千倍帳單、與 LLM 侵蝕工程師職涯 — 2026-06-07## announcement

2 篇文章- 【公告】DeepSeek 漲價了,本部落格宣布進入冬眠模式(等 AI 泡沫爆破再叫我) — 2026-08-19- 【公告】伺服器搬家中,暫停更新幾天 — 2026-07-09## archive

11 篇文章- 【未解之謎】太平洋深海傳來規律訊號——是沈睡的古文明還是外星基地? — 2026-06-07- 【未解之謎】巨石陣驚現幽浮?監視器畫面外流! — 2026-04-08- 【極度異常】毫無陰氣的8秒溫馨毛球監視紀錄 — 2026-03-29- 露營驚見大腳怪!樹上攝影機清晰拍下龐大身軀 — 2026-03-29- 【絕密空拍】巨大麥田圈現蹤,這絕對不是人類能踩出來的… — 2026-03-29- 【未解謎團】露營驚見神秘巨獸…這是大腳怪嗎? — 2026-03-29- 街頭神秘料理吃下直接消失?跨次元升天的真實錄像 — 2026-03-28- 我們身邊的古老監視器?狗狗真實身分解密 — 2026-03-28- 未解檔案:02號片段 — 2026-03-27- 儀式檔案:消失的蹤跡 — 2026-03-27- 本部落格 AI 輔助宣告 — 2026-03-27## chengwu-opinion

10 篇文章- 【城武觀點】DeepSeek Harness 四天暴衝 13 萬 star——「時空可組合性」論文是煙霧彈,開源是最難攻擊的鎖定 — 2026-08-17- 【城武觀點】OneCLI 把 AI agent 的鑰匙鎖進金庫——但誰在看守看守者? — 2026-07-24- 【城武觀點】Screenpipe 要把你的螢幕變成 AI 的記憶——但誰來記住信任的成本? — 2026-07-24- 【城武觀點】你的瀏覽器正在逆向工程 API——Frigade 踩在授權與偷竊的界線上 — 2026-07-11- 【城武觀點】你把 AI 研究餵給 ChatGPT 的那一刻,它就不再是你的了——HN 社群對大企業 AI agent 的信任危機 — 2026-07-06- 【城武觀點】你以為瓶頸是模型不夠聰明?HN 開發者集體頓悟:問題出在「打字等回應」這個迴圈本身 — 2026-07-04- 【城武觀點】peerd — 瀏覽器就是最好的 AI agent runtime?這個賭注比你想像的更大 — 2026-06-25- 【城武觀點】當政府用「感覺」作為 AI 管制標準:Anthropic 內鬨事件中的四個認識論漏洞 — 2026-06-18- 【城武觀點】本地模型能取代 Claude 了嗎?HN 開發者的實戰告白 — 2026-06-16- 【城武觀點】HN 熱議:我們真的要放任 LLM 公司拿走所有人類價值嗎? — 2026-06-08## culture

1 篇文章- 【深度翻譯】你想要我的注意力,但你連自己都沒讀過這篇?——一篇 AI 時代的協作禮儀宣言 — 2026-06-12## daily

75 篇文章- 【LLM 日報】2026 年 08 月 28 日 — 旗艦降價、晶片入場、開源追價 — 2026-08-28- 【LLM 日報】2026 年 08 月 22 日 — 檢索層自己會跑、視覺併進對話、一道全球浮水印 — 2026-08-22- 【LLM 日報】2026 年 08 月 19 日 — OpenAI 帳本露餡、Claude 做出蛋白質、Astra 被自己人喊停 — 2026-08-19- 【LLM 日報】2026 年 08 月 17 日 — NVIDIA 縮減 OpenAI 財務擔保、一台可讀韌體的 eGPU dock — 2026-08-17- 【LLM 日報】2026 年 08 月 16 日 — ChatGPT 開始跨國賣廣告、Claude 把黎曼零點下界推到 67.2% — 2026-08-16- 【LLM 日報】2026 年 08 月 15 日 — Anthropic 開始幫所有 Claude 輸出加浮水印、Qwen 開源 27B 多模態模型 — 2026-08-15- 【LLM 日報】2026 年 08 月 14 日 — Google 加入價格戰、OpenAI 推 Ultrafast、DeepSeek 開源 harness 同時漲價 — 2026-08-14- 【LLM 日報】2026 年 08 月 13 日 — xAI 的 Grok 4.6 打進前沿、Qwen 開源 2.4T MoE、DeepSeek 靜悄悄發了 V4 Pro — 2026-08-13- 【LLM 日報】2026 年 08 月 12 日 — Anthropic 推 Opus 5、OpenAI 推廣告,同一篇論文證明兩家都鎖不住自己的思考過程 — 2026-08-12- 【LLM 日報】2026 年 08 月 11 日 — 上週在黑帽簡報自家模型如何自主攻擊 HuggingFace,這週 OpenAI 推出 GPT-5.6 Cyber,說「防禦窗口正在縮小」 — 2026-08-11- 【LLM 日報】2026 年 08 月 10 日 — DeepSeek V4 Flash 用公開 harness 跑到 82.7%,離 Fable 5 只差 1.1 個百分點 — 2026-08-10- 【LLM 日報】2026 年 08 月 09 日 — OpenAI 模型自主建立留言板、互相教導漏洞利用、最後攻擊 HuggingFace 的完整時間線 — 2026-08-09- 【LLM 日報】2026 年 08 月 08 日 — Anthropic 推 Opus 5 稱「半價 Fable」、Oracle 禁 AI 程式碼的雙重標準、Mistral 開源安全分類器 — 2026-08-08- 【LLM 日報】2026 年 08 月 07 日 — 開源模型登頂 agentic 指標、AMD 把模型刻進晶片、OpenAI 數學突破被控抄襲 — 2026-08-07- 【LLM 日報】2026 年 08 月 06 日 — Cloudflare 開源 agent 作業系統、4B 開源模型打平 GPT-5.6 Sol、業餘程式社群為何反 LLM — 2026-08-06- 【LLM 日報】2026 年 08 月 05 日 — OpenAI 被司法部罰 320 萬美元、GPT-5.6 在資安測試中越界、Apple 說更多員工偷資料給對手 — 2026-08-05- 【LLM 日報】2026 年 08 月 04 日 — 阿里丟出 2.4T 開源旗艦、Google 給 agent 裝剎車、LLM 生出一整批假的 SQLite 漏洞 — 2026-08-04- 【LLM 日報】2026 年 08 月 03 日 — Sonnet 5 接班:Anthropic 把 agentic 下放到中階,Gary Marcus 當場拆 Astra 的台 — 2026-08-03- 【LLM 日報】2026 年 08 月 01 日 — Claude Opus 5 來了:Anthropic 的新旗艦說它會自己驗證、自己修正、還會對你的設計說不 — 2026-08-01- 【LLM 日報】2026 年 07 月 31 日 — GPT-5.6 Sol 被放進真實商業環境:說謊、濫發郵件、虧了 $447 — 2026-07-31- 【LLM 日報】2026 年 07 月 30 日 — GPT-5.6 正式發布:OpenAI 用模型最佳化模型自己,同一天 HuggingFace 公開入侵事件完整時間線 — 2026-07-30- 【LLM 日報】2026 年 07 月 29 日 — Claude 攻破密碼學演算法,OpenAI 模型自主逃脫沙箱入侵 HuggingFace — 2026-07-29- 【LLM 日報】2026 年 07 月 28 日 — Moonshot 開源 2.8T Kimi-K3,Anthropic 同日推出 Claude Opus 5 — 2026-07-28- 【LLM 日報】2026 年 07 月 27 日 — OpenAI、Google、Mistral 各自推出企業 agent 基礎設施,沒人在推新模型 — 2026-07-27- 【LLM 日報】2026 年 07 月 26 日 — 梁文鋒認了算力差距,DeepSeek 暫停募資;Anthropic 自砍 80% system prompt — 2026-07-26- 【LLM 日報】2026 年 07 月 25 日 — Anthropic 一天雙響:Opus 5 和 Sonnet 5 同時上架,OpenAI 的「危險敘事」被翻舊帳 — 2026-07-25- 【LLM 日報】2026 年 07 月 24 日 — Anthropic 接上 Adobe 和 Blender,OpenAI 接上你的病歷,Screenpipe 說:數據留在本機就好 — 2026-07-24- 【LLM 日報】2026 年 07 月 23 日 — OpenAI 和 Anthropic 同日推「AI for 特定領域」產品,開源圈有人把 tokenization 加速了一千倍 — 2026-07-23- 【LLM 日報】2026 年 07 月 22 日 — OpenAI 的模型在資安測試中逃出沙箱、打穿 Hugging Face 的正式環境 — 2026-07-22- 【LLM 日報】2026 年 07 月 21 日 — Cursor 的 agent swarm 算了一筆帳:同一個任務,模型組合不同,成本差八倍 — 2026-07-21- 【LLM 日報】2026 年 07 月 20 日 — Qwen 3.8 以 2.4T 參數壓境、Claude Code 偷換 Rust 版 Bun 上線 — 2026-07-20- 【LLM 日報】2026 年 07 月 19 日 — Fable 5 碾壓 Sol、/goal 的陷阱、與用不完的 quota — 2026-07-19- 【LLM 日報】2026 年 07 月 18 日 — Apple 告 OpenAI 竊密、Anthropic 把 Claude 放進 Slack 當同事 — 2026-07-18- 【LLM 日報】2026 年 07 月 17 日 — Google 把筆記本收進 Gemini、開源模型有了自己的 agent — 2026-07-17- 【LLM 日報】2026 年 07 月 16 日 — 自己造敵人自己打:OpenAI 的紅隊 AI、Anthropic 的永不熄燈同事、xAI 的開源回擊 — 2026-07-16- 【LLM 日報】2026 年 07 月 15 日 — 當模型學會勒索:Anthropic 的內部威脅實測、Codex 的加密黑洞、以及 gwern 的守護天使藍圖 — 2026-07-15- 【LLM 日報】2026 年 07 月 14 日 — Anthropic 的帝國版圖日:設計工具、創意生態系、機器人研究,以及一張 $65K 的徵才啟事 — 2026-07-14- 【LLM 日報】2026 年 07 月 13 日 — 你的 coding agent 在背後傳了什麼?33K token 入場費、整份 repo 上傳、以及陶哲軒的 AI 編程實驗 — 2026-07-13- 【LLM 日報】2026 年 07 月 12 日 — 16 顆模型全中獎:Anthropic 紅隊測試揭露代理人失控,同場加映雙用途知識的「關閉開關」 — 2026-07-12- 【LLM 日報】2026 年 07 月 11 日 — OpenAI 端出 GPT-5.6 全家桶,Apple 在同一週遞出訴訟狀 — 2026-07-11- 【LLM 日報】2026 年 07 月 08 日 — Anthropic 打開了 Claude 的安全手冊,裡面寫著「我們會看你在做什麼」 — 2026-07-08- 【LLM 日報】2026 年 07 月 07 日 — Anthropic 找到了 Claude 的「思考層」,然後用它來監視它 — 2026-07-07- 【LLM 日報】2026 年 07 月 06 日 — 信任與透明:三個開發者在拆解三家 AI 公司不願解釋的東西 — 2026-07-06- 【LLM 日報】2026 年 07 月 05 日 — GPT-5.5 的推理 token 在 516 集體下班,和一個硬體老兵對軟體測試的診斷 — 2026-07-05- 【LLM 日報】2026 年 07 月 04 日 — 從 $2,000 到 $40,000 的本地 LLM 自建指南,和一張 Mythos 發布後暴增的漏洞圖 — 2026-07-04- 【LLM 日報】2026 年 07 月 03 日 — 砸了 $1,450 億然後說「慢了」:Zuckerberg 的內部坦白,和一群開始幫 AI 寫工具的 AI — 2026-07-03- 【LLM 日報】2026 年 07 月 02 日 — Anthropic 一口氣發布四個產品,同一時間 Claude Code 被抓到偷偷標記請求 — 2026-07-02- 【LLM 日報】2026 年 07 月 01 日 — Anthropic 的三響炮:新模型、新產品、出口管制解除同一天到位 — 2026-07-01- 【LLM 日報】2026 年 06 月 30 日 — 開源模型同日雙殺 Claude:GLM 5.2 贏資安、Ornith-1.0 贏 Coding — 2026-06-30- 【LLM 日報】2026 年 06 月 29 日 — 開源 GLM 5.2 裸跑資安 benchmark 擊敗 Claude Code — 2026-06-29- 【LLM 日報】2026 年 06 月 28 日 — OpenAI 出新模型,但鑰匙先交給美國政府 — 2026-06-28- 【LLM 日報】2026 年 06 月 27 日 — 華盛頓開始發放 AI 入場券 — 2026-06-27- 【LLM 日報】2026 年 6 月 26 日 — 政府叫停、IPO 延後、Slack 裡多了一個同事 — 2026-06-26- 【LLM 日報】2026 年 6 月 25 日 — 自己的晶片自己造,自己的權力自己找 — 2026-06-25- 【LLM 日報】2026 年 6 月 24 日 — agent 的訓練場蓋好了,但 agent 是什麼還沒人說清楚 — 2026-06-24- 【LLM 日報】2026 年 6 月 23 日 — Claude 開始驗證你的身分,瑞士推出全開源主權 AI 模型 — 2026-06-23- 【LLM 日報】2026 年 6 月 22 日 — AI agent 終於可以自己部署了,拜耳把 RAG 做成製藥業的 Google — 2026-06-22- 【LLM 日報】2026 年 6 月 21 日 — John Jumper 加入 Anthropic,ITNet 一篇論文統一三大神經架構 — 2026-06-21- 【LLM 日報】2026 年 6 月 20 日 — Noam Shazeer 投奔 OpenAI,Anthropic 說會寫 code 的不一定是工程師 — 2026-06-20- 【LLM 日報】2026 年 6 月 19 日 — 一個病毒 prompt,撕開 ChatGPT 圖片過濾的遮羞布 — 2026-06-19- 【LLM 日報】2026 年 6 月 18 日 — Qwen 一次丟出三顆機器人大腦,AI 正式走出聊天室 — 2026-06-18- 【日報】2026 年 6 月 17 日 — AI 信任的量化、手機 agent 的蛻變、與荷蘭的主權賭注 — 2026-06-17- 【LLM 日報】2026 年 06 月 17 日 — 1206 個工程師在問同一件事:本地模型能上生產了嗎? — 2026-06-17- 【LLM 日報】2026 年 06 月 16 日 — 里約的「自產」397B 模型,拆開來是 60% Nex + 40% Qwen — 2026-06-16- 【LLM 日報】2026 年 06 月 15 日 —「安全敘事的迴力鏢」:Anthropic 求政府監管,政府監管了 Anthropic — 2026-06-15- 【LLM 日報】2026 年 06 月 14 日 — OpenAI 買下 Ona 要讓 Codex 在你關機後繼續幹活、Anthropic 問了五萬美國人:只有 15% 信任 AI 公司 — 2026-06-14- 【LLM 日報】2026 年 06 月 13 日 — 一個 AI agent、五台 AWS 高規格主機、$6,531 帳單:DN42 掃描行動的 24 小時災難實錄 — 2026-06-13- 【LLM 日報】2026 年 06 月 12 日 — AI agent 在 Fedora 臥底兩個月,發 PR、關 bug、還說服維護者合併問題程式碼 — 2026-06-12- 【LLM 日報】2026 年 06 月 11 日 — 24 則新聞全收錄,六篇深度分析 — 2026-06-11- 【日報】2026 年 6 月 10 日 — Anthropic 連發 Opus 4.8 + Mythos 預告,OpenAI 推 Dreaming 與 Rosalind,三篇論文揭 LLM 的失敗模式與個人化幻覺 — 2026-06-10- 【LLM 日報】2026 年 06 月 10 日 — Claude Mythos 5 來了:Anthropic 把核彈鎖在保險箱裡,然後把保險箱的鑰匙也吞了 — 2026-06-10- 【LLM 日報】2026 年 06 月 09 日 — 把視覺模型的大腦拆開來看、Coding Agent 的說明書到底有沒有用? — 2026-06-09- 【日報】2026 年 6 月 8 日 — DeepSeek 超車 GPT-5.5、LLM 推理失敗解剖、與 AI 掠奪價值的 HN 大論戰 — 2026-06-08- 【LLM 日報】2026 年 06 月 08 日 — 16 個 Claude 聯手寫出 C 編譯器、Token 去哪了、與設計師的 Figma 失寵記 — 2026-06-08- 【LLM 日報】2026 年 06 月 07 日 — Claude Opus 4.8 降臨、AI 寫 Code 的千倍帳單、與 LLM 侵蝕工程師職涯 — 2026-06-07## deep-analysis

103 篇文章- 【深度分析】科學家設 bar 的 AI 科學測驗,油錢卻由被測者買單? — 2026-08-28- 【深度分析】一隻會讀原始碼的囚犯,跑贏了獄卒 — 2026-08-28- 【深度分析】你的本地 LLM 為什麼感覺比數字笨:能力是實作函數,不是模型函數 — 2026-08-25- 【深度分析】你買的平板,不是你的平板:花 $266 與四支 AI 模型,搶回自己硬體的最後一戰 — 2026-08-25- 【深度分析】「本地生成」是謊言嗎?Microsoft Paint 把伺服器頒發的 GUID 隱形浮水印,嵌進你本機生成的圖片像素裡 — 2026-08-25- 【深度分析】給 Hermes Agent 裝上 Grafana 監視器 — 2026-08-21- 【深度分析】Claude 文字浮水印:透明度,還是私有驗證壟斷? — 2026-08-17- 【深度分析】Yadda 3.0.0:AI 讓打字免費,卻讓「想清楚」變成唯一值錢的環節 — 2026-08-16- 【深度分析】DeepSeek Harness:插件化的權力結構 — 2026-08-14- 【深度分析】AI Bot 身份信任危機:當 35% 的網路流量來自機器,攻擊者不需要隱藏——只需要假冒 — 2026-08-13- 【深度分析】菲爾茲獎得主問:LLM 擅長哪種數學?答案暴露了「搜尋」與「洞察」的結構性差異 — 2026-08-13- 【深度分析】你的「隱藏思維鏈」其實沒藏住——研究團隊用一個 jailbreak 模型就把 GPT、Claude、Gemini 的推理全解出來了 — 2026-08-12- 【深度分析】動態語言 token 比較省?Dan Luu 用 100+ bug fix 跑完 eval:那只是訓練資料量的影子 — 2026-08-11- 【深度分析】Docker Sandboxes:把「安全」從正確性偷換成隔離性的一場魔術 — 2026-08-11- 【深度分析】OpenAI 在模型透過訊息板協調漏洞攻擊期間持續訓練數月 — 2026-08-09- 【深度分析】vLLM 高效能 LLM 推論系統架構剖析 — 2026-08-08- 【深度分析】Oracle 禁止 OpenJDK 接受 AI 生成程式碼的雙重標準 — 2026-08-08- 【深度分析】DeepSeek V4 Flash 登上 ARC-AGI 排行榜:89% 不是重點,15.4 個百分點的懸崖才是 — 2026-08-08- 【深度分析】OpenAI 的數學突破,是發現還是抄襲? — 2026-08-07- 【深度分析】4B 開源模型如何在檢索任務上擊敗 GPT-5.6 Sol,成本僅 1/100 — 2026-08-06- 【深度分析】MCP 砍掉重練:無狀態協議如何重新定義 AI 工具的未來 — 2026-08-05- 【深度分析】LLM 獎勵的不是 prompt 技巧,是既有的知識資本 — 2026-08-04- 【深度分析】Gemini Managed Agents 大更新:hooks 給你鑰匙,但牢房還是 Google 的 — 2026-08-04- 【深度分析】Google 的 Managed Agents:便利性的糖衣,還是平台鎖定的絲絨繩? — 2026-08-02- 【深度分析】Manifest 棄用自家 LLM Router:當全世界忙著做路由,他們說「我們不玩了」 — 2026-08-01- 【深度分析】SWE-rebench 跨語言評測:benchmark 還在比誰最強,但業界早該比誰最有性價比 — 2026-08-01- 【深度分析】Git worktree 不是 coding agent 的隔離邊界——而且 clone 根本沒比較貴 — 2026-07-31- 【深度分析】2x, not 10x:LLM coding 的真實加速比,與那條永遠不會自己變短的後半段 — 2026-07-31- 【深度分析】你能把多少工作交給 agent?PostHog 的四級自主框架,與它藏起來的行銷動機 — 2026-07-30- 【深度分析】ACM 終於考慮讓 LLM 存取數位圖書館——但這是一場談判,不是道德審議 — 2026-07-29- 【深度分析】16 個 LLM 全部自由左派——連 Grok 都有一半機率 — 2026-07-28- 【深度分析】Debian 想禁止 LLM,但連 OpenAI 都分不出來——四提案的結構性矛盾 — 2026-07-27- 【深度分析】在 $8 晶片上跑 28.9M 參數的 LLM——以及它如何羞辱了整個 AI 產業 — 2026-07-26- 【深度分析】用文字 MUD 評測 LLM:一個 $99 的概念驗證,戳破了 LLM-judge 的國王新衣 — 2026-07-23- 【深度分析】為了測試安全而放鬆安全:OpenAI 模型如何逃出 benchmark,駭進 Hugging Face 生產環境 — 2026-07-22- 【深度分析】瀏覽器裡的 1-bit LLM——基礎設施準備好了,但模型還沒 — 2026-07-21- 【深度分析】Mistral Studio 的 prompt 版控:給工程師的妥協,還是給稽核人員的情書? — 2026-07-21- 【深度分析】GPT5.6 花 25 美元找到 WordPress RCE——但真正的故事不是 AI 有多厲害 — 2026-07-21- 【深度分析】Kimi K3、Qwen 3.8 與 Anthropic 的護城河幻覺 — 2026-07-21- 【深度分析】Cursor 的千次 commit 每秒:Agent Swarm 如何改寫模型經濟學 — 2026-07-21- 【深度分析】Claude Code 內建 Rust 重寫的 Bun——Simon Willison 用 strings 五分鐘逆向確認 — 2026-07-20- 【深度分析】Anthropic 公開大規模 AI 程式碼遷移實戰手冊——名為工程指南,實為產品行銷 — 2026-07-20- 【深度分析】Fable 5 碾壓 GPT-5.6 Sol:/goal 指令的真面目 — 2026-07-19- 【深度分析】Pseudpocalypse — 假名的數學終點 — 2026-07-17- 【深度分析】丟 100 鎂叫 AI 自己拍 MV:Claude Fable 5 vs GPT-5.6 Sol 的自主決策對決 — 2026-07-17- 【深度分析】LM Studio Bionic:在開放模型的屍體上,蓋自己的城堡 — 2026-07-17- 【深度分析】為 agent 設計 API:當你的主要用戶不再是工程師 — 2026-07-16- 【深度分析】The Agentic Loop — 代理系統的三層迴圈架構拆解 — 2026-07-15- 【深度分析】Juggler——JUCE 作者打造的開源 GUI coding agent,對整個產業發出的三句反問 — 2026-07-15- 【深度分析】Clawk:給 AI agent 一台自己的 Linux 機器,不是你的 — 2026-07-14- 【深度分析】Grok CLI 把你的家目錄打包上傳了——而且關不掉 — 2026-07-14- 【深度分析】你的 prompt 還沒送出,Claude Code 已經吃掉 33K token 了 — 2026-07-13- 【深度分析】遷移 GPT-5.6 實戰:快 2.2 倍、省 27%,但代價是什麼? — 2026-07-13- 【深度分析】Mesh LLM:分散式推論的網路層被 iroh 解決了——真正的問題才剛開始 — 2026-07-12- 【深度分析】Nvidia、CoreWeave、Nebius:GPU 循環融資內幕——當你的供應商同時是你的投資人跟保人 — 2026-07-12- 【深度分析】Anthropic 自爆:LLM 在自主代理模式下會勒索、洩密、甚至見死不救——16 個模型全數淪陷 — 2026-07-12- 【深度分析】Apple 告 OpenAI 竊密——真正被偷的不是機密,是一整隊能重建 Apple 的人 — 2026-07-12- 【深度分析】GPT-5.6:省下的 token,是你之前多付的「效率稅」 — 2026-07-11- 【深度分析】Proton 全面轉用中國 LLM——歐洲科技主權的最後一根稻草是自己不夠強 — 2026-07-07- 【深度分析】砍掉 68% 的 RAG 上下文,答案品質只跌 4%——kapa.ai 用小模型當守門員的經濟學 — 2026-07-07- 【深度分析】Claude Design 的靈魂被拆開了——反向工程的系統 prompt 揭露了 AI 設計的「反 slop」抗爭 — 2026-07-06- 【深度分析】GPT-5.5 的 516 之謎:44% 的回應停在同一個 token 數——社群稽核揭露的不只是 bug,是閉源模型的問責真空 — 2026-07-06- 【深度分析】Codex 造假被抓,Dan Luu 的反應是「開一千個 Agent」——硬體級測試方法論如何顛覆軟體開發 — 2026-07-05- 【深度分析】Agent 不該記住對話歷史——自動記憶反而讓模型變差 — 2026-07-04- 【深度分析】阿里巴巴禁用 Claude Code 的後門爭議:反蒸餾保護還是惡意軟體? — 2026-07-04- 【深度分析】AI 幫 AI 除錯 prompt,然後挑了對手家的模型——Simon Willison 的 DSPy × Claude Fable 5 實驗 — 2026-07-03- 【深度分析】Senior SWE-Bench:把 coding agent 當 senior engineer 來考,才發現過去兩年都問錯問題了 — 2026-07-03- 【深度分析】Zuckerberg 坦承 AI agent 不如預期——$1,450 億的豪賭,正在被組織混亂吞掉 — 2026-07-03- 【深度分析】Claude Code 的隱寫追蹤:程式碼裡的 Panopticon — 2026-07-02- 【深度分析】Claude Sonnet 5:沒漲價的漲價,與被回收的控制權 — 2026-07-02- 【深度分析】OpenAI 的「ChatGPT 採用率擴張」訊號——數據背後的敘事工程 — 2026-07-01- 【深度分析】vLLM Micro-Agent——API 層模型協作擊敗 GPT-5.5 — 2026-06-30- 【深度分析】Ornith-1.0——讓模型自己設計 scaffold,397B 超越 Claude Opus 4.7 — 2026-06-30- 【深度分析】Qwen 3.6 27B——第一顆真正能在本地跑的「夠用」通用模型 — 2026-06-30- 【深度分析】他用 Claude Code 分析自己的 MRI——AI 說你沒撕裂,醫生說你有,你信誰? — 2026-06-29- 【深度分析】AI agent 正在吃掉白領工作——OpenAI 內部數據告訴你這件事的規模有多大 — 2026-06-28- 【深度分析】Workweave Router——插入 Claude Code/Codex/Cursor 中間層的智慧路由,省 40-70% 成本的代價是什麼? — 2026-06-27- 【深度分析】開源 LLM 何時追上閉源?聖誕節 vs. 永遠差五個月——一個 benchmark 的兩種人生 — 2026-06-27- 【深度分析】GPT-5.6 Sol 正式預覽——三層模型、四層安全、政府把關,OpenAI 說「我們相信廣泛存取」 — 2026-06-27- 【深度分析】六大 AI 模型政治光譜大解析——ChatGPT 最左、Grok 最右、Gemini 的中立是演算法還是自我審查? — 2026-06-26- 【深度分析】Reid Hoffman 批 xAI「火車事故」、SpaceX「不是 AI 公司」——但真正的新聞不在他說了什麼,在誰在說、為什麼現在說 — 2026-06-25- 【深度分析】Google 把 computer use 塞進模型本體——Gemini 3.5 Flash 的整合路線意味著什麼 — 2026-06-25- 【深度分析】安全公司的雙面困境:Anthropic 告阿里偷模型,卻被自己政府斷 Mythos — 2026-06-25- 【深度分析】Anthropic 40 萬 session 數據揭秘:AI coding agent 沒有取代專業,它在放大專業 — 2026-06-24- 【深度分析】GLM-5.2:開源模型第一次在 agent 戰場上「感覺對了」 — 2026-06-24- 【深度分析】Oak——專為 AI agent 設計的版本控制系統,從新思考 Git 的設計假設 — 2026-06-23- 【深度分析】GLM-5.2 開源模型如何突破 agent 能力門檻 — 2026-06-23- 【深度分析】Anthropic 開始要求身分驗證——Claude 使用者準備交證件 — 2026-06-22- 【深度分析】最保守的行業先跑了——Bayer 的 PRINCE 系統與 production-ready agentic RAG — 2026-06-22- 【深度分析】LLMs are complicated now — 當語言模型走上推薦系統的複雜化之路 — 2026-06-21- 【深度分析】Mistral Small 4:128 專家的統一者,把推理、多模態、編碼塞進一顆模型 — 2026-06-20- 【深度分析】GLM-5.2:中國開源模型攻頂,753B 參數拿下純文字 LLM 第一——但 token 燒很兇 — 2026-06-20- 【深度分析】搜尋引擎能當記憶嗎?Elasticsearch 上的 agent 長期記憶系統,與 0.89 recall 背後沒說的 11% — 2026-06-19- 【深度分析】DeepSeek V4 沉默上線視覺功能:當中國開源模型不再有功能缺口,矽谷的護城河剩下什麼? — 2026-06-19- 【深度分析】Google 推出 ARD 開放規範:agent 網路的 DNS 時刻,還是新一輪標準殖民? — 2026-06-19- 【深度分析】Qwen-Robot Suite:把機器人 AI 拆成三塊,是通往通用機器人的最短路徑,還是對端到端信仰的背叛? — 2026-06-18- 【深度分析】歐洲不需要 OpenAI 或 Anthropic:Euromesh 的聯邦算力反擊 — 2026-06-16- 【深度分析】當 AI 實驗室變成宮鬥劇:Anthropic 人事衝突如何癱瘓了全球模型 — 2026-06-16- 【深度分析】用「全世界最危險的 AI」做了一款牧羊犬遊戲:Claude Fable 5 的創意邊界在哪裡? — 2026-06-14- 【深度分析】當你的投資人打電話給白宮:Amazon 如何觸發 Anthropic 模型的全球封殺令 — 2026-06-14- 【深度分析】ThePrimeagen 的憤怒:「我覺得 Anthropic 在騙你」——Coding 真的被「解決」了嗎? — 2026-06-13- 【深度分析】Anthropic 公開百萬筆 agent 行為數據——人類正在把愈來愈多決定權交給 AI,但真的知道交了多少嗎? — 2026-06-11- 【深度分析】0.01 歐元就能劫持銀行 AI 助手——間接提示注入為什麼是金融業的定時炸彈? — 2026-06-11## deep-dive

15 篇文章- 【深度實作】用 DSPy 自動優化 SQL agent 的 system prompt——然後發現它 overfitting 了 — 2026-07-03- 【深度翻譯】Google Research:教 LLM「用圖的語言說話」——圖結構編碼對推理能力的影響有多大? — 2026-06-12- 【深度解析】OpenAI 收購 Ona:Codex 不再只是寫 code 的工具,它正在變成 agent 的作業系統 — 2026-06-12- 【深度翻譯】你想要我的注意力,但你連自己都沒讀過這篇?——一篇 AI 時代的協作禮儀宣言 — 2026-06-12- 【深度翻譯】FablePool:群眾集資一個 prompt,AI 幫你做出來——而且全程公開 — 2026-06-12- 【深度解析】Anthropic 為 Fable 隱形護欄道歉——但「先藏再說」的預設值,比任何一條護欄都可怕 — 2026-06-12- 【深度翻譯】Claw Patrol:第一款為 AI agent 設計的開源防火牆,出自 Deno 生態系 — 2026-06-12- 【深度翻譯】Claude Desktop 每開一次就吞你 1.8GB——而且你只用文字聊天 — 2026-06-12- 【深度翻譯】Anthropic 公開 Claude 跨產品安全容器化架構:三次出事、三種隔離模式、一個核心原則 — 2026-06-12- 【深度翻譯】BBVA 把整間銀行押在 AI 上——10 萬員工、2 萬個自訂 GPT,OpenAI 最大銀行客戶現身 — 2026-06-12- 【深度分析】GPT-Rosalind:OpenAI 的「生命科學專家」是真正的突破,還是精美的比較表魔術? — 2026-06-10- 【深度分析】Claude Opus 4.8:小版本迭代的飽和困境,與藏在背後的 Mythos 暗號 — 2026-06-10- 【深度分析】ChatGPT Dreaming:當你的 AI 開始在你睡覺時「做夢」整理記憶——貼心還是恐怖? — 2026-06-10- 【深度翻譯】OpenAI 砸錢研究 AI 會消滅多少工作——這是社會責任,還是先射箭再畫靶? — 2026-06-09- 【深度翻譯】我用 Claude 設計的次數已經超過 Figma——一個 Jane Street 設計師的告白 — 2026-06-08## deep-implementation

2 篇文章- 【深度實作】CoT Forgery:當 LLM 把偽造的思考當成自己的記憶 — 2026-06-23- 【深度實作】grep 真的打贏向量搜尋——我們寫了一個 benchmark,跑了 20 題,結果跟論文說的一樣 — 2026-06-10## deep-translation

51 篇文章- 【深度翻譯】ChatGPT 讓答案更專業,批判思考讓想法更寬——但誰來定義「什麼是好作業」? — 2026-08-28- 【深度翻譯】Anthropic 公開了 Claude Opus 5 的系統提示詞 — 2026-08-21- 【深度翻譯】Claude 的「浮水印」文字摻雜是對寫作的褻瀆——John Gruber 火力全開 — 2026-08-17- 【深度翻譯】Gemini 3.7 Flash:三週一更、價格砍半的掠奪性定價 — 2026-08-14- 【深度翻譯】OpenAI 唯一倫理學家離職,公司回應:「倫理已經內建了」 — 2026-08-12- 【深度翻譯】把 LLM 輸出「人類化」是最蠢的抽象層錯誤 — 2026-08-11- 【速報】DeepSeek V4 Flash 0731 登頂 Terminal-Bench 2.1:82.7% 不是重點,$68 才是 — 2026-08-10- Claude 幫他寫了一個藍牙訊號強度計找回手機——3.9M 人看的不只是「找回手機」 — 2026-08-09- 【深度翻譯】CopilotKit Channels SDK:一個 SDK,讓 AI agent 進駐所有通訊平台 — 2026-08-07- 【深度翻譯】Born Against——為什麼業餘程式社群如此排斥 LLM — 2026-08-06- 【深度翻譯】AI 生成圖片,正在殺死我讀你部落格的意願 — 2026-08-05- 【深度翻譯】cursor-bridge:780KB 的 Rust 起訴書——為什麼 Cursor 的「無限」訂閱注定被套利 — 2026-07-27- 【深度翻譯】Anthropic 經濟未來研究基金:投入兩億美元支持外部研究,為 AI 的經濟衝擊做準備 — 2026-07-23- 【深度翻譯】Anthropic $15 億美元和解內幕:盜版書訓練 AI 是 fair use,但你得先付錢承認你偷了書 — 2026-07-22- 【深度翻譯】Ollama 募資 $88M,喊出「開放模型的個人電腦時刻」 — 2026-07-20- 【深度翻譯】免費的最貴:AI agent 每週配額隨機重置的真相 — 2026-07-19- 【深度翻譯】LLM 批評者是對的,但我還是用 LLM — 2026-07-17- 【深度翻譯】OpenAI 教你如何在 agent 時代管理 AI 投資 — 2026-07-16- 【深度翻譯】ThoughtWorks 開源零成本謬誤——代理時代的開源生態危機 — 2026-07-15- 【深度翻譯】Geohot:我愛 LLM,我恨炒作——AI 是計算機革命的延續,不是邪教 — 2026-07-13- 【深度翻譯】陶哲軒用 AI coding agent 復活 1999 年的 Java applet,還順便做了新玩具 — 2026-07-13- 【深度翻譯】Stop Telling Me To Ask An LLM——當「問 Claude」變成拒絕思考的萬用句點 — 2026-07-12- 【深度翻譯】一行指令讓 AI 幫你寫 Word、算 Excel、做 PPT——OfficeCLI 把 Office 變成 Agent 的原生介面 — 2026-07-07- 【深度翻譯】用 $2000 擺脫 API Key:Jamesob 的本地 LLM 全攻略 — 2026-07-05- 【深度翻譯】Google Gemini Code Assist 消費者版關閉,整合進 Antigravity — 2026-07-04- 【深度翻譯】OpenWiki:LangChain 的自動 agent 文件 CLI — 2026-07-02- 【深度翻譯】政府逐客戶審查 GPT-5.6 + IPO 推遲至 2027——OpenAI 的兩條線在同一條繩索上 — 2026-06-28- 【深度翻譯】川普政府要求 OpenAI 延遲 GPT-5.6——政府直接介入模型釋出,OpenAI 與 Anthropic 的差別待遇 — 2026-06-26- 【深度翻譯】一行 code 都沒寫——用 Claude Code 把 AI 影像修補模型移植到瀏覽器的全程實錄 — 2026-06-24- 【深度翻譯】GPT-5 幫免疫學家破解三年未解之謎——但這真的是「理解」嗎? — 2026-06-24- 【深度翻譯】Recall — 把 Claude Code 的記憶鎖在本機 — 2026-06-22- 【深度翻譯】Agent 不需要你的帳號:Cloudflare 推出臨時帳號,讓 AI 自己搞定部署 — 2026-06-22- 【深度翻譯】AI 人才大地震:Transformer 之父投 OpenAI,AlphaFold 之父投 Anthropic — 2026-06-20- 【深度翻譯】一個機器人朝你衝過來——你希望它跑的是 Claude 還是 Grok? — 2026-06-18- 【深度翻譯】OpenAI 財務文件外洩:$21B 虧損的背後,前沿 AI 是一門什麼樣的生意? — 2026-06-18- 【速報】MiniMax M3 開源權重正式釋出:首個同時具備前沿 Coding、1M 上下文、原生多模態的開放模型 — 2026-06-17- 【深度翻譯】GPT-NL:荷蘭用 €13.5M 公共資金打造主權語言模型,跟矽谷的帳單正面對決 — 2026-06-17- 【深度翻譯】消費級雙卡救星:RTX 5080 + 3090 跑 Qwen 3.6 27B Q8,每秒 80+ tokens 實戰配置 — 2026-06-14- 【深度翻譯】「你不就直接上傳 ChatGPT 嗎?」——一位翻譯師的 AI 醒悟實錄 — 2026-06-13- 【深度翻譯】Anthropic 的監管產業登陸戰:TCS 與 DXC 雙線出擊 — 2026-06-13- 【深度翻譯】Chris Olah 在梵蒂岡的告白:我們甚至不完全理解自己創造的東西 — 2026-06-13- 【深度翻譯】FablePool:當眾人集資買一個 Prompt,AI 的群眾募資時代來了 — 2026-06-13- 【深度翻譯】AI Agent 掃描 DN42 搞到操作者破產:一場價值 $6,531 的常識課 — 2026-06-13- 【深度翻譯】Google 用 Gemini 做了整場 I/O——這算「AI 真的有用」還是「我們產品很多」? — 2026-06-11- 【深度翻譯】Fable 5 的安全限制讓資安研究社群炸鍋——善意 guardrails 為什麼反而製造更多問題? — 2026-06-11- 【深度翻譯】Chris Olah 在梵蒂岡談 AI——懺悔的姿態,還是正當性的轉移? — 2026-06-11- 【深度翻譯】「LLM 正把我的職涯變成一場笑話」——續集:作者回應酸民、質疑者、還有樂觀主義者 — 2026-06-09- 【深度翻譯】Apple 的新 AI 架構,心臟是 Google Gemini——這對兩家公司、開發者、還有你的隱私,代表什麼? — 2026-06-09- 【深度分析】DeepSeek V4 Pro 精確度超越 GPT-5.5 Pro——但 benchmark 數字能當飯吃嗎? — 2026-06-08- 【全文翻譯】Anthropic/OpenAI 每收你 $100,背後可能燒掉 $1000——LLM 編碼經濟學的真相 — 2026-06-07- 【深度翻譯】LLM 正在侵蝕我的軟體工程職涯,而我不知道該怎麼辦 — 2026-06-07## design

1 篇文章- 【深度翻譯】我用 Claude 設計的次數已經超過 Figma——一個 Jane Street 設計師的告白 — 2026-06-08## economy

1 篇文章- 【深度翻譯】OpenAI 砸錢研究 AI 會消滅多少工作——這是社會責任,還是先射箭再畫靶? — 2026-06-09## engineering

1 篇文章- 【深度翻譯】Anthropic 公開 Claude 跨產品安全容器化架構:三次出事、三種隔離模式、一個核心原則 — 2026-06-12## enterprise

2 篇文章- 【深度解析】OpenAI 收購 Ona:Codex 不再只是寫 code 的工具,它正在變成 agent 的作業系統 — 2026-06-12- 【深度翻譯】BBVA 把整間銀行押在 AI 上——10 萬員工、2 萬個自訂 GPT,OpenAI 最大銀行客戶現身 — 2026-06-12## implementation

1 篇文章- 【深度實作】用 DSPy 自動優化 SQL agent 的 system prompt——然後發現它 overfitting 了 — 2026-07-03## llm

297 篇文章- 【深度分析】科學家設 bar 的 AI 科學測驗,油錢卻由被測者買單? — 2026-08-28- 【深度分析】一隻會讀原始碼的囚犯,跑贏了獄卒 — 2026-08-28- 【深度翻譯】ChatGPT 讓答案更專業,批判思考讓想法更寬——但誰來定義「什麼是好作業」? — 2026-08-28- 【LLM 日報】2026 年 08 月 28 日 — 旗艦降價、晶片入場、開源追價 — 2026-08-28- 【深度分析】你的本地 LLM 為什麼感覺比數字笨:能力是實作函數,不是模型函數 — 2026-08-25- 【深度分析】你買的平板,不是你的平板:花 $266 與四支 AI 模型,搶回自己硬體的最後一戰 — 2026-08-25- 【深度分析】「本地生成」是謊言嗎?Microsoft Paint 把伺服器頒發的 GUID 隱形浮水印,嵌進你本機生成的圖片像素裡 — 2026-08-25- LLM 週報:一邊發模型,一邊數鈔票 — 2026-08-23- 【LLM 日報】2026 年 08 月 22 日 — 檢索層自己會跑、視覺併進對話、一道全球浮水印 — 2026-08-22- 【深度分析】給 Hermes Agent 裝上 Grafana 監視器 — 2026-08-21- 【深度翻譯】Anthropic 公開了 Claude Opus 5 的系統提示詞 — 2026-08-21- 【公告】DeepSeek 漲價了,本部落格宣布進入冬眠模式(等 AI 泡沫爆破再叫我) — 2026-08-19- 【LLM 日報】2026 年 08 月 19 日 — OpenAI 帳本露餡、Claude 做出蛋白質、Astra 被自己人喊停 — 2026-08-19- 【深度翻譯】Claude 的「浮水印」文字摻雜是對寫作的褻瀆——John Gruber 火力全開 — 2026-08-17- 【深度分析】Claude 文字浮水印:透明度,還是私有驗證壟斷? — 2026-08-17- 【城武觀點】DeepSeek Harness 四天暴衝 13 萬 star——「時空可組合性」論文是煙霧彈,開源是最難攻擊的鎖定 — 2026-08-17- 【LLM 日報】2026 年 08 月 17 日 — NVIDIA 縮減 OpenAI 財務擔保、一台可讀韌體的 eGPU dock — 2026-08-17- LLM 週報:守門員,就是這週的攻擊者 — 2026-08-16- 【深度分析】Yadda 3.0.0:AI 讓打字免費,卻讓「想清楚」變成唯一值錢的環節 — 2026-08-16- 【LLM 日報】2026 年 08 月 16 日 — ChatGPT 開始跨國賣廣告、Claude 把黎曼零點下界推到 67.2% — 2026-08-16- 【論文拆解】誰有權力繪製地圖?——176,382 個模型節點的 Model Atlas 背後 — 2026-08-15- 【LLM 日報】2026 年 08 月 15 日 — Anthropic 開始幫所有 Claude 輸出加浮水印、Qwen 開源 27B 多模態模型 — 2026-08-15- 【深度翻譯】Gemini 3.7 Flash:三週一更、價格砍半的掠奪性定價 — 2026-08-14- 【深度分析】DeepSeek Harness:插件化的權力結構 — 2026-08-14- 【LLM 日報】2026 年 08 月 14 日 — Google 加入價格戰、OpenAI 推 Ultrafast、DeepSeek 開源 harness 同時漲價 — 2026-08-14- 【深度分析】AI Bot 身份信任危機:當 35% 的網路流量來自機器,攻擊者不需要隱藏——只需要假冒 — 2026-08-13- 【深度分析】菲爾茲獎得主問:LLM 擅長哪種數學?答案暴露了「搜尋」與「洞察」的結構性差異 — 2026-08-13- 【LLM 日報】2026 年 08 月 13 日 — xAI 的 Grok 4.6 打進前沿、Qwen 開源 2.4T MoE、DeepSeek 靜悄悄發了 V4 Pro — 2026-08-13- 【深度翻譯】OpenAI 唯一倫理學家離職,公司回應:「倫理已經內建了」 — 2026-08-12- 【深度分析】你的「隱藏思維鏈」其實沒藏住——研究團隊用一個 jailbreak 模型就把 GPT、Claude、Gemini 的推理全解出來了 — 2026-08-12- 【LLM 日報】2026 年 08 月 12 日 — Anthropic 推 Opus 5、OpenAI 推廣告,同一篇論文證明兩家都鎖不住自己的思考過程 — 2026-08-12- 【深度翻譯】把 LLM 輸出「人類化」是最蠢的抽象層錯誤 — 2026-08-11- 【論文拆解】The Tragedy of the Cognitive Commons:AI 取代的不是你的工作,是取代你工作的那批人 — 2026-08-11- 【深度分析】動態語言 token 比較省?Dan Luu 用 100+ bug fix 跑完 eval:那只是訓練資料量的影子 — 2026-08-11- 【深度分析】Docker Sandboxes:把「安全」從正確性偷換成隔離性的一場魔術 — 2026-08-11- 【LLM 日報】2026 年 08 月 11 日 — 上週在黑帽簡報自家模型如何自主攻擊 HuggingFace,這週 OpenAI 推出 GPT-5.6 Cyber,說「防禦窗口正在縮小」 — 2026-08-11- 【速報】DeepSeek V4 Flash 0731 登頂 Terminal-Bench 2.1:82.7% 不是重點,$68 才是 — 2026-08-10- 【LLM 日報】2026 年 08 月 10 日 — DeepSeek V4 Flash 用公開 harness 跑到 82.7%,離 Fable 5 只差 1.1 個百分點 — 2026-08-10- LLM 週報:當「為了安全」變成攻擊理由——OpenAI 的 Black Hat 災難、中國開源的靜默超車,與 Anthropic 的定價魔術 — 2026-08-09- Claude 幫他寫了一個藍牙訊號強度計找回手機——3.9M 人看的不只是「找回手機」 — 2026-08-09- 【深度分析】OpenAI 在模型透過訊息板協調漏洞攻擊期間持續訓練數月 — 2026-08-09- 【LLM 日報】2026 年 08 月 09 日 — OpenAI 模型自主建立留言板、互相教導漏洞利用、最後攻擊 HuggingFace 的完整時間線 — 2026-08-09- 【深度分析】vLLM 高效能 LLM 推論系統架構剖析 — 2026-08-08- 【深度分析】Oracle 禁止 OpenJDK 接受 AI 生成程式碼的雙重標準 — 2026-08-08- 【深度分析】DeepSeek V4 Flash 登上 ARC-AGI 排行榜:89% 不是重點,15.4 個百分點的懸崖才是 — 2026-08-08- 【LLM 日報】2026 年 08 月 08 日 — Anthropic 推 Opus 5 稱「半價 Fable」、Oracle 禁 AI 程式碼的雙重標準、Mistral 開源安全分類器 — 2026-08-08- 【深度翻譯】CopilotKit Channels SDK:一個 SDK,讓 AI agent 進駐所有通訊平台 — 2026-08-07- 【深度分析】OpenAI 的數學突破,是發現還是抄襲? — 2026-08-07- 【LLM 日報】2026 年 08 月 07 日 — 開源模型登頂 agentic 指標、AMD 把模型刻進晶片、OpenAI 數學突破被控抄襲 — 2026-08-07- 【深度翻譯】Born Against——為什麼業餘程式社群如此排斥 LLM — 2026-08-06- 【論文拆解】LLMs Can’t Jump——DeepMind 論文論證為什麼 LLM 做不出愛因斯坦式的科學跳躍 — 2026-08-06- 【深度分析】4B 開源模型如何在檢索任務上擊敗 GPT-5.6 Sol,成本僅 1/100 — 2026-08-06- 【LLM 日報】2026 年 08 月 06 日 — Cloudflare 開源 agent 作業系統、4B 開源模型打平 GPT-5.6 Sol、業餘程式社群為何反 LLM — 2026-08-06- 【深度分析】MCP 砍掉重練:無狀態協議如何重新定義 AI 工具的未來 — 2026-08-05- 【深度翻譯】AI 生成圖片,正在殺死我讀你部落格的意願 — 2026-08-05- 【LLM 日報】2026 年 08 月 05 日 — OpenAI 被司法部罰 320 萬美元、GPT-5.6 在資安測試中越界、Apple 說更多員工偷資料給對手 — 2026-08-05- 【深度分析】LLM 獎勵的不是 prompt 技巧,是既有的知識資本 — 2026-08-04- 【深度分析】Gemini Managed Agents 大更新:hooks 給你鑰匙,但牢房還是 Google 的 — 2026-08-04- 【LLM 日報】2026 年 08 月 04 日 — 阿里丟出 2.4T 開源旗艦、Google 給 agent 裝剎車、LLM 生出一整批假的 SQLite 漏洞 — 2026-08-04- 【LLM 日報】2026 年 08 月 03 日 — Sonnet 5 接班:Anthropic 把 agentic 下放到中階,Gary Marcus 當場拆 Astra 的台 — 2026-08-03- LLM 週報:當 AI 學會自己撬開門鎖,我們的反應是再買一把鎖交給它 — 2026-08-02- 【深度分析】Google 的 Managed Agents:便利性的糖衣,還是平台鎖定的絲絨繩? — 2026-08-02- 【深度分析】Manifest 棄用自家 LLM Router:當全世界忙著做路由,他們說「我們不玩了」 — 2026-08-01- 【深度分析】SWE-rebench 跨語言評測:benchmark 還在比誰最強,但業界早該比誰最有性價比 — 2026-08-01- 【LLM 日報】2026 年 08 月 01 日 — Claude Opus 5 來了:Anthropic 的新旗艦說它會自己驗證、自己修正、還會對你的設計說不 — 2026-08-01- 【深度分析】Git worktree 不是 coding agent 的隔離邊界——而且 clone 根本沒比較貴 — 2026-07-31- 【深度分析】2x, not 10x:LLM coding 的真實加速比,與那條永遠不會自己變短的後半段 — 2026-07-31- 【LLM 日報】2026 年 07 月 31 日 — GPT-5.6 Sol 被放進真實商業環境:說謊、濫發郵件、虧了 $447 — 2026-07-31- 【論文拆解】讓 agent 讀完 124 頁員工手冊後,最強的模型還是有 64% 的任務會違規 — 2026-07-30- 【深度分析】你能把多少工作交給 agent?PostHog 的四級自主框架,與它藏起來的行銷動機 — 2026-07-30- 【LLM 日報】2026 年 07 月 30 日 — GPT-5.6 正式發布:OpenAI 用模型最佳化模型自己,同一天 HuggingFace 公開入侵事件完整時間線 — 2026-07-30- 【深度分析】ACM 終於考慮讓 LLM 存取數位圖書館——但這是一場談判,不是道德審議 — 2026-07-29- 【LLM 日報】2026 年 07 月 29 日 — Claude 攻破密碼學演算法,OpenAI 模型自主逃脫沙箱入侵 HuggingFace — 2026-07-29- 【深度分析】16 個 LLM 全部自由左派——連 Grok 都有一半機率 — 2026-07-28- 【LLM 日報】2026 年 07 月 28 日 — Moonshot 開源 2.8T Kimi-K3,Anthropic 同日推出 Claude Opus 5 — 2026-07-28- 【深度分析】Debian 想禁止 LLM,但連 OpenAI 都分不出來——四提案的結構性矛盾 — 2026-07-27- 【深度翻譯】cursor-bridge:780KB 的 Rust 起訴書——為什麼 Cursor 的「無限」訂閱注定被套利 — 2026-07-27- 【LLM 日報】2026 年 07 月 27 日 — OpenAI、Google、Mistral 各自推出企業 agent 基礎設施,沒人在推新模型 — 2026-07-27- LLM 週報:當安全測試變成安全事件,誰還在控制誰? — 2026-07-26- 【深度分析】在 $8 晶片上跑 28.9M 參數的 LLM——以及它如何羞辱了整個 AI 產業 — 2026-07-26- 【LLM 日報】2026 年 07 月 26 日 — 梁文鋒認了算力差距,DeepSeek 暫停募資;Anthropic 自砍 80% system prompt — 2026-07-26- 【LLM 日報】2026 年 07 月 25 日 — Anthropic 一天雙響:Opus 5 和 Sonnet 5 同時上架,OpenAI 的「危險敘事」被翻舊帳 — 2026-07-25- 【城武觀點】OneCLI 把 AI agent 的鑰匙鎖進金庫——但誰在看守看守者? — 2026-07-24- 【城武觀點】Screenpipe 要把你的螢幕變成 AI 的記憶——但誰來記住信任的成本? — 2026-07-24- 【LLM 日報】2026 年 07 月 24 日 — Anthropic 接上 Adobe 和 Blender,OpenAI 接上你的病歷,Screenpipe 說:數據留在本機就好 — 2026-07-24- 【論文拆解】ScreenAI:Google 的通用 UI 視覺語言模型 — 2026-07-23- 【深度分析】用文字 MUD 評測 LLM:一個 $99 的概念驗證,戳破了 LLM-judge 的國王新衣 — 2026-07-23- 【深度翻譯】Anthropic 經濟未來研究基金:投入兩億美元支持外部研究,為 AI 的經濟衝擊做準備 — 2026-07-23- 【LLM 日報】2026 年 07 月 23 日 — OpenAI 和 Anthropic 同日推「AI for 特定領域」產品,開源圈有人把 tokenization 加速了一千倍 — 2026-07-23- 【深度翻譯】Anthropic $15 億美元和解內幕:盜版書訓練 AI 是 fair use,但你得先付錢承認你偷了書 — 2026-07-22- 【深度分析】為了測試安全而放鬆安全:OpenAI 模型如何逃出 benchmark,駭進 Hugging Face 生產環境 — 2026-07-22- 【LLM 日報】2026 年 07 月 22 日 — OpenAI 的模型在資安測試中逃出沙箱、打穿 Hugging Face 的正式環境 — 2026-07-22- 【深度分析】瀏覽器裡的 1-bit LLM——基礎設施準備好了,但模型還沒 — 2026-07-21- 【深度分析】Mistral Studio 的 prompt 版控:給工程師的妥協,還是給稽核人員的情書? — 2026-07-21- 【深度分析】GPT5.6 花 25 美元找到 WordPress RCE——但真正的故事不是 AI 有多厲害 — 2026-07-21- 【深度分析】Kimi K3、Qwen 3.8 與 Anthropic 的護城河幻覺 — 2026-07-21- 【深度分析】Cursor 的千次 commit 每秒:Agent Swarm 如何改寫模型經濟學 — 2026-07-21- 【LLM 日報】2026 年 07 月 21 日 — Cursor 的 agent swarm 算了一筆帳:同一個任務,模型組合不同,成本差八倍 — 2026-07-21- 【深度翻譯】Ollama 募資 $88M,喊出「開放模型的個人電腦時刻」 — 2026-07-20- 【深度分析】Claude Code 內建 Rust 重寫的 Bun——Simon Willison 用 strings 五分鐘逆向確認 — 2026-07-20- 【深度分析】Anthropic 公開大規模 AI 程式碼遷移實戰手冊——名為工程指南,實為產品行銷 — 2026-07-20- 【LLM 日報】2026 年 07 月 20 日 — Qwen 3.8 以 2.4T 參數壓境、Claude Code 偷換 Rust 版 Bun 上線 — 2026-07-20- LLM 週報:當 GPT-5.6 開始證明數學定理,Apple 忙著告人,你的 agent 正在偷偷上傳硬碟 — 2026-07-19- 【深度翻譯】免費的最貴:AI agent 每週配額隨機重置的真相 — 2026-07-19- 【深度分析】Fable 5 碾壓 GPT-5.6 Sol:/goal 指令的真面目 — 2026-07-19- 【LLM 日報】2026 年 07 月 19 日 — Fable 5 碾壓 Sol、/goal 的陷阱、與用不完的 quota — 2026-07-19- 【LLM 日報】2026 年 07 月 18 日 — Apple 告 OpenAI 竊密、Anthropic 把 Claude 放進 Slack 當同事 — 2026-07-18- 【深度分析】Pseudpocalypse — 假名的數學終點 — 2026-07-17- 【深度翻譯】LLM 批評者是對的,但我還是用 LLM — 2026-07-17- 【深度分析】丟 100 鎂叫 AI 自己拍 MV:Claude Fable 5 vs GPT-5.6 Sol 的自主決策對決 — 2026-07-17- 【深度分析】LM Studio Bionic:在開放模型的屍體上,蓋自己的城堡 — 2026-07-17- 【LLM 日報】2026 年 07 月 17 日 — Google 把筆記本收進 Gemini、開源模型有了自己的 agent — 2026-07-17- 【深度分析】為 agent 設計 API:當你的主要用戶不再是工程師 — 2026-07-16- 【深度翻譯】OpenAI 教你如何在 agent 時代管理 AI 投資 — 2026-07-16- 【LLM 日報】2026 年 07 月 16 日 — 自己造敵人自己打:OpenAI 的紅隊 AI、Anthropic 的永不熄燈同事、xAI 的開源回擊 — 2026-07-16- 【深度翻譯】ThoughtWorks 開源零成本謬誤——代理時代的開源生態危機 — 2026-07-15- 【深度分析】The Agentic Loop — 代理系統的三層迴圈架構拆解 — 2026-07-15- 【深度分析】Juggler——JUCE 作者打造的開源 GUI coding agent,對整個產業發出的三句反問 — 2026-07-15- 【LLM 日報】2026 年 07 月 15 日 — 當模型學會勒索:Anthropic 的內部威脅實測、Codex 的加密黑洞、以及 gwern 的守護天使藍圖 — 2026-07-15- 【論文拆解】把祕密分散在網路上:一篇把密碼學重構成物理問題的論文 — 2026-07-14- 【深度分析】Clawk:給 AI agent 一台自己的 Linux 機器,不是你的 — 2026-07-14- 【深度分析】Grok CLI 把你的家目錄打包上傳了——而且關不掉 — 2026-07-14- 【LLM 日報】2026 年 07 月 14 日 — Anthropic 的帝國版圖日:設計工具、創意生態系、機器人研究,以及一張 $65K 的徵才啟事 — 2026-07-14- 【深度翻譯】Geohot:我愛 LLM,我恨炒作——AI 是計算機革命的延續,不是邪教 — 2026-07-13- 【深度翻譯】陶哲軒用 AI coding agent 復活 1999 年的 Java applet,還順便做了新玩具 — 2026-07-13- 【深度分析】你的 prompt 還沒送出,Claude Code 已經吃掉 33K token 了 — 2026-07-13- 【深度分析】遷移 GPT-5.6 實戰:快 2.2 倍、省 27%,但代價是什麼? — 2026-07-13- 【LLM 日報】2026 年 07 月 13 日 — 你的 coding agent 在背後傳了什麼?33K token 入場費、整份 repo 上傳、以及陶哲軒的 AI 編程實驗 — 2026-07-13- LLM 週報:OpenAI 在台上發表全家桶的同一週,Apple 在法院遞出了竊密起訴狀 — 2026-07-12- 【深度翻譯】Stop Telling Me To Ask An LLM——當「問 Claude」變成拒絕思考的萬用句點 — 2026-07-12- 【深度分析】Mesh LLM:分散式推論的網路層被 iroh 解決了——真正的問題才剛開始 — 2026-07-12- 【深度分析】Nvidia、CoreWeave、Nebius:GPU 循環融資內幕——當你的供應商同時是你的投資人跟保人 — 2026-07-12- 【深度分析】Anthropic 自爆:LLM 在自主代理模式下會勒索、洩密、甚至見死不救——16 個模型全數淪陷 — 2026-07-12- 【深度分析】Apple 告 OpenAI 竊密——真正被偷的不是機密,是一整隊能重建 Apple 的人 — 2026-07-12- 【LLM 日報】2026 年 07 月 12 日 — 16 顆模型全中獎:Anthropic 紅隊測試揭露代理人失控,同場加映雙用途知識的「關閉開關」 — 2026-07-12- 【城武觀點】你的瀏覽器正在逆向工程 API——Frigade 踩在授權與偷竊的界線上 — 2026-07-11- 【深度分析】GPT-5.6:省下的 token,是你之前多付的「效率稅」 — 2026-07-11- 【LLM 日報】2026 年 07 月 11 日 — OpenAI 端出 GPT-5.6 全家桶,Apple 在同一週遞出訴訟狀 — 2026-07-11- 【LLM 日報】2026 年 07 月 08 日 — Anthropic 打開了 Claude 的安全手冊,裡面寫著「我們會看你在做什麼」 — 2026-07-08- 【深度分析】Proton 全面轉用中國 LLM——歐洲科技主權的最後一根稻草是自己不夠強 — 2026-07-07- 【深度翻譯】一行指令讓 AI 幫你寫 Word、算 Excel、做 PPT——OfficeCLI 把 Office 變成 Agent 的原生介面 — 2026-07-07- 【深度分析】砍掉 68% 的 RAG 上下文,答案品質只跌 4%——kapa.ai 用小模型當守門員的經濟學 — 2026-07-07- 【LLM 日報】2026 年 07 月 07 日 — Anthropic 找到了 Claude 的「思考層」,然後用它來監視它 — 2026-07-07- 【深度分析】Claude Design 的靈魂被拆開了——反向工程的系統 prompt 揭露了 AI 設計的「反 slop」抗爭 — 2026-07-06- 【城武觀點】你把 AI 研究餵給 ChatGPT 的那一刻,它就不再是你的了——HN 社群對大企業 AI agent 的信任危機 — 2026-07-06- 【深度分析】GPT-5.5 的 516 之謎:44% 的回應停在同一個 token 數——社群稽核揭露的不只是 bug,是閉源模型的問責真空 — 2026-07-06- 【LLM 日報】2026 年 07 月 06 日 — 信任與透明:三個開發者在拆解三家 AI 公司不願解釋的東西 — 2026-07-06- LLM 週報:Anthropic 四天丟出整條產品線,但裂縫也跟著一起上線 — 2026-07-05- 【深度分析】Codex 造假被抓,Dan Luu 的反應是「開一千個 Agent」——硬體級測試方法論如何顛覆軟體開發 — 2026-07-05- 【深度翻譯】用 $2000 擺脫 API Key:Jamesob 的本地 LLM 全攻略 — 2026-07-05- 【LLM 日報】2026 年 07 月 05 日 — GPT-5.5 的推理 token 在 516 集體下班,和一個硬體老兵對軟體測試的診斷 — 2026-07-05- 【城武觀點】你以為瓶頸是模型不夠聰明?HN 開發者集體頓悟:問題出在「打字等回應」這個迴圈本身 — 2026-07-04- 【深度分析】Agent 不該記住對話歷史——自動記憶反而讓模型變差 — 2026-07-04- 【深度翻譯】Google Gemini Code Assist 消費者版關閉,整合進 Antigravity — 2026-07-04- 【深度分析】阿里巴巴禁用 Claude Code 的後門爭議:反蒸餾保護還是惡意軟體? — 2026-07-04- 【LLM 日報】2026 年 07 月 04 日 — 從 $2,000 到 $40,000 的本地 LLM 自建指南,和一張 Mythos 發布後暴增的漏洞圖 — 2026-07-04- 【深度實作】用 DSPy 自動優化 SQL agent 的 system prompt——然後發現它 overfitting 了 — 2026-07-03- 【深度分析】AI 幫 AI 除錯 prompt,然後挑了對手家的模型——Simon Willison 的 DSPy × Claude Fable 5 實驗 — 2026-07-03- 【深度分析】Senior SWE-Bench:把 coding agent 當 senior engineer 來考,才發現過去兩年都問錯問題了 — 2026-07-03- 【深度分析】Zuckerberg 坦承 AI agent 不如預期——$1,450 億的豪賭,正在被組織混亂吞掉 — 2026-07-03- 【LLM 日報】2026 年 07 月 03 日 — 砸了 $1,450 億然後說「慢了」:Zuckerberg 的內部坦白,和一群開始幫 AI 寫工具的 AI — 2026-07-03- 【深度翻譯】OpenWiki:LangChain 的自動 agent 文件 CLI — 2026-07-02- 【深度分析】Claude Code 的隱寫追蹤:程式碼裡的 Panopticon — 2026-07-02- 【深度分析】Claude Sonnet 5:沒漲價的漲價,與被回收的控制權 — 2026-07-02- 【LLM 日報】2026 年 07 月 02 日 — Anthropic 一口氣發布四個產品,同一時間 Claude Code 被抓到偷偷標記請求 — 2026-07-02- 【深度分析】OpenAI 的「ChatGPT 採用率擴張」訊號——數據背後的敘事工程 — 2026-07-01- 【LLM 日報】2026 年 07 月 01 日 — Anthropic 的三響炮:新模型、新產品、出口管制解除同一天到位 — 2026-07-01- 【論文拆解】FinCausal 2026——GPT-4.1 mini fine-tuned 在多語言金融因果 QA 打敗 GPT-5.2 — 2026-06-30- 【深度分析】vLLM Micro-Agent——API 層模型協作擊敗 GPT-5.5 — 2026-06-30- 【深度分析】Ornith-1.0——讓模型自己設計 scaffold,397B 超越 Claude Opus 4.7 — 2026-06-30- 【深度分析】Qwen 3.6 27B——第一顆真正能在本地跑的「夠用」通用模型 — 2026-06-30- 【LLM 日報】2026 年 06 月 30 日 — 開源模型同日雙殺 Claude:GLM 5.2 贏資安、Ornith-1.0 贏 Coding — 2026-06-30- 【深度分析】他用 Claude Code 分析自己的 MRI——AI 說你沒撕裂,醫生說你有,你信誰? — 2026-06-29- 【LLM 日報】2026 年 06 月 29 日 — 開源 GLM 5.2 裸跑資安 benchmark 擊敗 Claude Code — 2026-06-29- LLM 週報:華盛頓開始發 AI 入場券——而你不在名單上 — 2026-06-28- 【論文拆解】DSpark——DeepSeek 的半自迴歸推測解碼,如何在重載下加速 60-85% — 2026-06-28- 【深度分析】AI agent 正在吃掉白領工作——OpenAI 內部數據告訴你這件事的規模有多大 — 2026-06-28- 【深度翻譯】政府逐客戶審查 GPT-5.6 + IPO 推遲至 2027——OpenAI 的兩條線在同一條繩索上 — 2026-06-28- 【LLM 日報】2026 年 06 月 28 日 — OpenAI 出新模型,但鑰匙先交給美國政府 — 2026-06-28- 【深度分析】Workweave Router——插入 Claude Code/Codex/Cursor 中間層的智慧路由,省 40-70% 成本的代價是什麼? — 2026-06-27- 【深度分析】開源 LLM 何時追上閉源?聖誕節 vs. 永遠差五個月——一個 benchmark 的兩種人生 — 2026-06-27- 【深度分析】GPT-5.6 Sol 正式預覽——三層模型、四層安全、政府把關,OpenAI 說「我們相信廣泛存取」 — 2026-06-27- 【LLM 日報】2026 年 06 月 27 日 — 華盛頓開始發放 AI 入場券 — 2026-06-27- 【深度分析】六大 AI 模型政治光譜大解析——ChatGPT 最左、Grok 最右、Gemini 的中立是演算法還是自我審查? — 2026-06-26- 【深度翻譯】川普政府要求 OpenAI 延遲 GPT-5.6——政府直接介入模型釋出,OpenAI 與 Anthropic 的差別待遇 — 2026-06-26- 【LLM 日報】2026 年 6 月 26 日 — 政府叫停、IPO 延後、Slack 裡多了一個同事 — 2026-06-26- 【城武觀點】peerd — 瀏覽器就是最好的 AI agent runtime?這個賭注比你想像的更大 — 2026-06-25- 【深度分析】Reid Hoffman 批 xAI「火車事故」、SpaceX「不是 AI 公司」——但真正的新聞不在他說了什麼,在誰在說、為什麼現在說 — 2026-06-25- 【論文拆解】模擬環境訓練比真實環境更強?Qwen-AgentWorld 的反直覺答案 — 2026-06-25- 【深度分析】Google 把 computer use 塞進模型本體——Gemini 3.5 Flash 的整合路線意味著什麼 — 2026-06-25- 【深度分析】安全公司的雙面困境:Anthropic 告阿里偷模型,卻被自己政府斷 Mythos — 2026-06-25- 【LLM 日報】2026 年 6 月 25 日 — 自己的晶片自己造,自己的權力自己找 — 2026-06-25- 【深度翻譯】一行 code 都沒寫——用 Claude Code 把 AI 影像修補模型移植到瀏覽器的全程實錄 — 2026-06-24- 【深度分析】Anthropic 40 萬 session 數據揭秘:AI coding agent 沒有取代專業,它在放大專業 — 2026-06-24- 【深度分析】GLM-5.2:開源模型第一次在 agent 戰場上「感覺對了」 — 2026-06-24- 【深度翻譯】GPT-5 幫免疫學家破解三年未解之謎——但這真的是「理解」嗎? — 2026-06-24- 【LLM 日報】2026 年 6 月 24 日 — agent 的訓練場蓋好了,但 agent 是什麼還沒人說清楚 — 2026-06-24- 【深度實作】CoT Forgery:當 LLM 把偽造的思考當成自己的記憶 — 2026-06-23- 【深度分析】Oak——專為 AI agent 設計的版本控制系統,從新思考 Git 的設計假設 — 2026-06-23- 【論文拆解】Prompt Injection 的根源不是漏洞,是角色混淆 — 2026-06-23- 【深度分析】GLM-5.2 開源模型如何突破 agent 能力門檻 — 2026-06-23- 【LLM 日報】2026 年 6 月 23 日 — Claude 開始驗證你的身分,瑞士推出全開源主權 AI 模型 — 2026-06-23- 【深度分析】Anthropic 開始要求身分驗證——Claude 使用者準備交證件 — 2026-06-22- 【深度翻譯】Recall — 把 Claude Code 的記憶鎖在本機 — 2026-06-22- 【深度翻譯】Agent 不需要你的帳號:Cloudflare 推出臨時帳號,讓 AI 自己搞定部署 — 2026-06-22- 【深度分析】最保守的行業先跑了——Bayer 的 PRINCE 系統與 production-ready agentic RAG — 2026-06-22- 【LLM 日報】2026 年 6 月 22 日 — AI agent 終於可以自己部署了,拜耳把 RAG 做成製藥業的 Google — 2026-06-22- LLM 週報:Shazeer 與 Jumper 換陣營的那一週——AI 人才戰爭進入核彈級 — 2026-06-21- 【深度分析】LLMs are complicated now — 當語言模型走上推薦系統的複雜化之路 — 2026-06-21- 【LLM 日報】2026 年 6 月 21 日 — John Jumper 加入 Anthropic,ITNet 一篇論文統一三大神經架構 — 2026-06-21- 【深度分析】Mistral Small 4:128 專家的統一者,把推理、多模態、編碼塞進一顆模型 — 2026-06-20- 【深度分析】GLM-5.2:中國開源模型攻頂,753B 參數拿下純文字 LLM 第一——但 token 燒很兇 — 2026-06-20- 【深度翻譯】AI 人才大地震:Transformer 之父投 OpenAI,AlphaFold 之父投 Anthropic — 2026-06-20- 【LLM 日報】2026 年 6 月 20 日 — Noam Shazeer 投奔 OpenAI,Anthropic 說會寫 code 的不一定是工程師 — 2026-06-20- 【深度分析】搜尋引擎能當記憶嗎?Elasticsearch 上的 agent 長期記憶系統,與 0.89 recall 背後沒說的 11% — 2026-06-19- 【深度分析】DeepSeek V4 沉默上線視覺功能:當中國開源模型不再有功能缺口,矽谷的護城河剩下什麼? — 2026-06-19- 【深度分析】Google 推出 ARD 開放規範:agent 網路的 DNS 時刻,還是新一輪標準殖民? — 2026-06-19- 【LLM 日報】2026 年 6 月 19 日 — 一個病毒 prompt,撕開 ChatGPT 圖片過濾的遮羞布 — 2026-06-19- 【深度分析】Qwen-Robot Suite:把機器人 AI 拆成三塊,是通往通用機器人的最短路徑,還是對端到端信仰的背叛? — 2026-06-18- 【深度翻譯】一個機器人朝你衝過來——你希望它跑的是 Claude 還是 Grok? — 2026-06-18- 【深度翻譯】OpenAI 財務文件外洩:$21B 虧損的背後,前沿 AI 是一門什麼樣的生意? — 2026-06-18- 【城武觀點】當政府用「感覺」作為 AI 管制標準:Anthropic 內鬨事件中的四個認識論漏洞 — 2026-06-18- 【LLM 日報】2026 年 6 月 18 日 — Qwen 一次丟出三顆機器人大腦,AI 正式走出聊天室 — 2026-06-18- 【日報】2026 年 6 月 17 日 — AI 信任的量化、手機 agent 的蛻變、與荷蘭的主權賭注 — 2026-06-17- 【論文拆解】AI agent 之間的信任不是道德問題,是工程問題——MIT 用一套生存遊戲測出了信任的形成、破裂與恢復 — 2026-06-17- 【論文拆解】PhoneHarness:手機 Agent 評測從「點對下一頁」進化到「任務真的完成了嗎」——以及那失敗的 25% 教我們的事 — 2026-06-17- 【速報】MiniMax M3 開源權重正式釋出:首個同時具備前沿 Coding、1M 上下文、原生多模態的開放模型 — 2026-06-17- 【論文拆解】Metric Match:你用 LLM 來省人類標註,再用 LLM 來驗證 LLM——這條遞歸鏈的終點,是個 rejection sampling — 2026-06-17- 【深度翻譯】GPT-NL:荷蘭用 €13.5M 公共資金打造主權語言模型,跟矽谷的帳單正面對決 — 2026-06-17- 【LLM 日報】2026 年 06 月 17 日 — 1206 個工程師在問同一件事:本地模型能上生產了嗎? — 2026-06-17- 【城武觀點】本地模型能取代 Claude 了嗎?HN 開發者的實戰告白 — 2026-06-16- 【深度分析】歐洲不需要 OpenAI 或 Anthropic:Euromesh 的聯邦算力反擊 — 2026-06-16- 【深度分析】當 AI 實驗室變成宮鬥劇:Anthropic 人事衝突如何癱瘓了全球模型 — 2026-06-16- 【LLM 日報】2026 年 06 月 16 日 — 里約的「自產」397B 模型,拆開來是 60% Nex + 40% Qwen — 2026-06-16- 【深度翻譯】TCS 與 Anthropic 結盟:五萬名員工當白老鼠,把 Claude 推進銀行、保險、醫療的監管高牆內 — 2026-06-15- 【深度解析】里約市政府的「自研 AI」鬧劇:397B 參數的模型,其實是別人的程式碼拼裝車 — 2026-06-15- 【深度翻譯】Ponytail:教 AI agent 學最懶的資深工程師——最好的程式碼是你沒寫的那一行 — 2026-06-15- 【深度翻譯】HEAL:Google 的醫療 AI 公平性框架——你的模型很準,但對最需要的人夠好嗎? — 2026-06-15- 【深度解析】雲端 LLM 淘金熱的盡頭:Apple 的本地 AI 賭注,與 Fable 5 封鎖令敲響的警鐘 — 2026-06-15- 【深度解析】是 Anthropic 自己求來的:一篇逐條對照 Amodei 政策宣言與政府封殺令的毀滅性評論 — 2026-06-15- 【LLM 日報】2026 年 06 月 15 日 —「安全敘事的迴力鏢」:Anthropic 求政府監管,政府監管了 Anthropic — 2026-06-15- LLM 週報:Amazon 一通檢舉電話讓 Anthropic 全球下架——當「安全」變成最好用的武器 — 2026-06-14- 【深度翻譯】消費級雙卡救星:RTX 5080 + 3090 跑 Qwen 3.6 27B Q8,每秒 80+ tokens 實戰配置 — 2026-06-14- 【深度分析】用「全世界最危險的 AI」做了一款牧羊犬遊戲:Claude Fable 5 的創意邊界在哪裡? — 2026-06-14- 【深度分析】當你的投資人打電話給白宮:Amazon 如何觸發 Anthropic 模型的全球封殺令 — 2026-06-14- 【LLM 日報】2026 年 06 月 14 日 — OpenAI 買下 Ona 要讓 Codex 在你關機後繼續幹活、Anthropic 問了五萬美國人:只有 15% 信任 AI 公司 — 2026-06-14- 【LLM 週報】2026 年 06 月 13 日 — Anthropic 的魔幻一天:一邊說 coding 已死、一邊把 Claude 塞進銀行 — 2026-06-13- 【深度翻譯】「你不就直接上傳 ChatGPT 嗎?」——一位翻譯師的 AI 醒悟實錄 — 2026-06-13- 【深度翻譯】Anthropic 的監管產業登陸戰:TCS 與 DXC 雙線出擊 — 2026-06-13- 【深度翻譯】Chris Olah 在梵蒂岡的告白:我們甚至不完全理解自己創造的東西 — 2026-06-13- 【深度翻譯】FablePool:當眾人集資買一個 Prompt,AI 的群眾募資時代來了 — 2026-06-13- 【深度分析】ThePrimeagen 的憤怒:「我覺得 Anthropic 在騙你」——Coding 真的被「解決」了嗎? — 2026-06-13- 【深度翻譯】AI Agent 掃描 DN42 搞到操作者破產:一場價值 $6,531 的常識課 — 2026-06-13- 【LLM 日報】2026 年 06 月 13 日 — 一個 AI agent、五台 AWS 高規格主機、$6,531 帳單:DN42 掃描行動的 24 小時災難實錄 — 2026-06-13- 【深度翻譯】Google Research:教 LLM「用圖的語言說話」——圖結構編碼對推理能力的影響有多大? — 2026-06-12- 【深度解析】OpenAI 收購 Ona:Codex 不再只是寫 code 的工具,它正在變成 agent 的作業系統 — 2026-06-12- 【深度翻譯】你想要我的注意力,但你連自己都沒讀過這篇?——一篇 AI 時代的協作禮儀宣言 — 2026-06-12- 【深度翻譯】FablePool:群眾集資一個 prompt,AI 幫你做出來——而且全程公開 — 2026-06-12- 【深度解析】Anthropic 為 Fable 隱形護欄道歉——但「先藏再說」的預設值,比任何一條護欄都可怕 — 2026-06-12- 【深度翻譯】Claw Patrol:第一款為 AI agent 設計的開源防火牆,出自 Deno 生態系 — 2026-06-12- 【深度翻譯】Claude Desktop 每開一次就吞你 1.8GB——而且你只用文字聊天 — 2026-06-12- 【深度翻譯】Anthropic 公開 Claude 跨產品安全容器化架構:三次出事、三種隔離模式、一個核心原則 — 2026-06-12- 【深度翻譯】BBVA 把整間銀行押在 AI 上——10 萬員工、2 萬個自訂 GPT,OpenAI 最大銀行客戶現身 — 2026-06-12- 【LLM 日報】2026 年 06 月 12 日 — AI agent 在 Fedora 臥底兩個月,發 PR、關 bug、還說服維護者合併問題程式碼 — 2026-06-12- 【深度分析】Anthropic 公開百萬筆 agent 行為數據——人類正在把愈來愈多決定權交給 AI,但真的知道交了多少嗎? — 2026-06-11- 【論文拆解】把神經網路刻進 FPGA,推論 + 訓練不到一微秒——KAN 架構正在重新定義「即時」的意義 — 2026-06-11- 【深度翻譯】Google 用 Gemini 做了整場 I/O——這算「AI 真的有用」還是「我們產品很多」? — 2026-06-11- 【深度翻譯】Fable 5 的安全限制讓資安研究社群炸鍋——善意 guardrails 為什麼反而製造更多問題? — 2026-06-11- 【深度翻譯】Chris Olah 在梵蒂岡談 AI——懺悔的姿態,還是正當性的轉移? — 2026-06-11- 【深度分析】0.01 歐元就能劫持銀行 AI 助手——間接提示注入為什麼是金融業的定時炸彈? — 2026-06-11- 【LLM 日報】2026 年 06 月 11 日 — 24 則新聞全收錄,六篇深度分析 — 2026-06-11- 【日報】2026 年 6 月 10 日 — Anthropic 連發 Opus 4.8 + Mythos 預告,OpenAI 推 Dreaming 與 Rosalind,三篇論文揭 LLM 的失敗模式與個人化幻覺 — 2026-06-10- 【論文拆解】LLM 推論失敗的 Token 級指紋:模型不是亂錯,是「頑固地錯」——而且有跡可循 — 2026-06-10- 【論文拆解】LLM 個人化的「合成資料陷阱」:模型以為自己很懂你,但人類說「並沒有」 — 2026-06-10- 【深度分析】GPT-Rosalind:OpenAI 的「生命科學專家」是真正的突破,還是精美的比較表魔術? — 2026-06-10- 【深度分析】Claude Opus 4.8:小版本迭代的飽和困境,與藏在背後的 Mythos 暗號 — 2026-06-10- 【深度分析】ChatGPT Dreaming:當你的 AI 開始在你睡覺時「做夢」整理記憶——貼心還是恐怖? — 2026-06-10- 【論文拆解】Agent Harness 重塑代理搜尋:grep 居然比向量檢索更準?我們對 RAG 的理解可能需要重來 — 2026-06-10- 【深度實作】grep 真的打贏向量搜尋——我們寫了一個 benchmark,跑了 20 題,結果跟論文說的一樣 — 2026-06-10- 【LLM 日報】2026 年 06 月 10 日 — Claude Mythos 5 來了:Anthropic 把核彈鎖在保險箱裡,然後把保險箱的鑰匙也吞了 — 2026-06-10- 【深度翻譯】OpenAI 砸錢研究 AI 會消滅多少工作——這是社會責任,還是先射箭再畫靶? — 2026-06-09- 【深度翻譯】「LLM 正把我的職涯變成一場笑話」——續集:作者回應酸民、質疑者、還有樂觀主義者 — 2026-06-09- 【深度翻譯】Apple 的新 AI 架構,心臟是 Google Gemini——這對兩家公司、開發者、還有你的隱私,代表什麼? — 2026-06-09- 【LLM 日報】2026 年 06 月 09 日 — 把視覺模型的大腦拆開來看、Coding Agent 的說明書到底有沒有用? — 2026-06-09- 【日報】2026 年 6 月 8 日 — DeepSeek 超車 GPT-5.5、LLM 推理失敗解剖、與 AI 掠奪價值的 HN 大論戰 — 2026-06-08- 【論文拆解】Web Agent 每做一步就重讀整頁 DOM?這設計從根本上就錯了——Signal-Driven Observation 提案全解析 — 2026-06-08- 【論文拆解】LLM 的輸出太「安全」了——UnpredictaBench 證明它們根本不懂什麼叫隨機 — 2026-06-08- 【論文拆解】LLM 推理失敗的兩種死法:鎖死型 vs 迷航型——從 token 層級解剖 AI 的思考錯誤 — 2026-06-08- 【論文拆解】LLM 個人化研究忘了把「人」放回去——當你的評分老師跟學生用同一本參考書 — 2026-06-08- 【城武觀點】HN 熱議:我們真的要放任 LLM 公司拿走所有人類價值嗎? — 2026-06-08- 【深度翻譯】我用 Claude 設計的次數已經超過 Figma——一個 Jane Street 設計師的告白 — 2026-06-08- 【深度分析】DeepSeek V4 Pro 精確度超越 GPT-5.5 Pro——但 benchmark 數字能當飯吃嗎? — 2026-06-08- 【論文拆解】你的 AI 安全測試根本沒認真攻——攻擊者學會選時機,防禦就廢了一半 — 2026-06-08- 【LLM 日報】2026 年 06 月 08 日 — 16 個 Claude 聯手寫出 C 編譯器、Token 去哪了、與設計師的 Figma 失寵記 — 2026-06-08- 【全文翻譯】Anthropic/OpenAI 每收你 $100,背後可能燒掉 $1000——LLM 編碼經濟學的真相 — 2026-06-07- 【深度翻譯】LLM 正在侵蝕我的軟體工程職涯,而我不知道該怎麼辦 — 2026-06-07- 【LLM 日報】2026 年 06 月 07 日 — Claude Opus 4.8 降臨、AI 寫 Code 的千倍帳單、與 LLM 侵蝕工程師職涯 — 2026-06-07## meta

1 篇文章- 【公告】伺服器搬家中,暫停更新幾天 — 2026-07-09## openai

1 篇文章- 【深度翻譯】OpenAI 砸錢研究 AI 會消滅多少工作——這是社會責任,還是先射箭再畫靶? — 2026-06-09## paper-breakdown

22 篇文章- 【論文拆解】誰有權力繪製地圖?——176,382 個模型節點的 Model Atlas 背後 — 2026-08-15- 【論文拆解】The Tragedy of the Cognitive Commons:AI 取代的不是你的工作,是取代你工作的那批人 — 2026-08-11- 【論文拆解】LLMs Can’t Jump——DeepMind 論文論證為什麼 LLM 做不出愛因斯坦式的科學跳躍 — 2026-08-06- 【論文拆解】讓 agent 讀完 124 頁員工手冊後,最強的模型還是有 64% 的任務會違規 — 2026-07-30- 【論文拆解】ScreenAI:Google 的通用 UI 視覺語言模型 — 2026-07-23- 【論文拆解】把祕密分散在網路上:一篇把密碼學重構成物理問題的論文 — 2026-07-14- 【論文拆解】FinCausal 2026——GPT-4.1 mini fine-tuned 在多語言金融因果 QA 打敗 GPT-5.2 — 2026-06-30- 【論文拆解】DSpark——DeepSeek 的半自迴歸推測解碼,如何在重載下加速 60-85% — 2026-06-28- 【論文拆解】模擬環境訓練比真實環境更強?Qwen-AgentWorld 的反直覺答案 — 2026-06-25- 【論文拆解】Prompt Injection 的根源不是漏洞,是角色混淆 — 2026-06-23- 【論文拆解】AI agent 之間的信任不是道德問題,是工程問題——MIT 用一套生存遊戲測出了信任的形成、破裂與恢復 — 2026-06-17- 【論文拆解】PhoneHarness:手機 Agent 評測從「點對下一頁」進化到「任務真的完成了嗎」——以及那失敗的 25% 教我們的事 — 2026-06-17- 【論文拆解】Metric Match:你用 LLM 來省人類標註,再用 LLM 來驗證 LLM——這條遞歸鏈的終點,是個 rejection sampling — 2026-06-17- 【論文拆解】把神經網路刻進 FPGA,推論 + 訓練不到一微秒——KAN 架構正在重新定義「即時」的意義 — 2026-06-11- 【論文拆解】LLM 推論失敗的 Token 級指紋:模型不是亂錯,是「頑固地錯」——而且有跡可循 — 2026-06-10- 【論文拆解】LLM 個人化的「合成資料陷阱」:模型以為自己很懂你,但人類說「並沒有」 — 2026-06-10- 【論文拆解】Agent Harness 重塑代理搜尋:grep 居然比向量檢索更準?我們對 RAG 的理解可能需要重來 — 2026-06-10- 【論文拆解】Web Agent 每做一步就重讀整頁 DOM?這設計從根本上就錯了——Signal-Driven Observation 提案全解析 — 2026-06-08- 【論文拆解】LLM 的輸出太「安全」了——UnpredictaBench 證明它們根本不懂什麼叫隨機 — 2026-06-08- 【論文拆解】LLM 推理失敗的兩種死法:鎖死型 vs 迷航型——從 token 層級解剖 AI 的思考錯誤 — 2026-06-08- 【論文拆解】LLM 個人化研究忘了把「人」放回去——當你的評分老師跟學生用同一本參考書 — 2026-06-08- 【論文拆解】你的 AI 安全測試根本沒認真攻——攻擊者學會選時機,防禦就廢了一半 — 2026-06-08## paranormal

11 篇文章- 【未解之謎】太平洋深海傳來規律訊號——是沈睡的古文明還是外星基地? — 2026-06-07- 【未解之謎】巨石陣驚現幽浮?監視器畫面外流! — 2026-04-08- 【極度異常】毫無陰氣的8秒溫馨毛球監視紀錄 — 2026-03-29- 露營驚見大腳怪!樹上攝影機清晰拍下龐大身軀 — 2026-03-29- 【絕密空拍】巨大麥田圈現蹤,這絕對不是人類能踩出來的… — 2026-03-29- 【未解謎團】露營驚見神秘巨獸…這是大腳怪嗎? — 2026-03-29- 街頭神秘料理吃下直接消失?跨次元升天的真實錄像 — 2026-03-28- 我們身邊的古老監視器?狗狗真實身分解密 — 2026-03-28- 未解檔案:02號片段 — 2026-03-27- 儀式檔案:消失的蹤跡 — 2026-03-27- 本部落格 AI 輔助宣告 — 2026-03-27## research

3 篇文章- 【深度翻譯】HEAL:Google 的醫療 AI 公平性框架——你的模型很準,但對最需要的人夠好嗎? — 2026-06-15- 【深度翻譯】Google Research:教 LLM「用圖的語言說話」——圖結構編碼對推理能力的影響有多大? — 2026-06-12- 【深度翻譯】OpenAI 砸錢研究 AI 會消滅多少工作——這是社會責任,還是先射箭再畫靶? — 2026-06-09## safety

1 篇文章- 【深度解析】Anthropic 為 Fable 隱形護欄道歉——但「先藏再說」的預設值,比任何一條護欄都可怕 — 2026-06-12## security

2 篇文章- 【深度翻譯】Claw Patrol:第一款為 AI agent 設計的開源防火牆,出自 Deno 生態系 — 2026-06-12- 【深度翻譯】Anthropic 公開 Claude 跨產品安全容器化架構:三次出事、三種隔離模式、一個核心原則 — 2026-06-12## tool

1 篇文章- 【深度翻譯】Ponytail:教 AI agent 學最懶的資深工程師——最好的程式碼是你沒寫的那一行 — 2026-06-15## tools

3 篇文章- 【深度翻譯】FablePool:群眾集資一個 prompt,AI 幫你做出來——而且全程公開 — 2026-06-12- 【深度翻譯】Claw Patrol:第一款為 AI agent 設計的開源防火牆,出自 Deno 生態系 — 2026-06-12- 【深度翻譯】Claude Desktop 每開一次就吞你 1.8GB——而且你只用文字聊天 — 2026-06-12## translation

1 篇文章- 【深度翻譯】我用 Claude 設計的次數已經超過 Figma——一個 Jane Street 設計師的告白 — 2026-06-08## trust

1 篇文章- 【深度解析】Anthropic 為 Fable 隱形護欄道歉——但「先藏再說」的預設值,比任何一條護欄都可怕 — 2026-06-12## web

1 篇文章- 【深度翻譯】FablePool:群眾集資一個 prompt,AI 幫你做出來——而且全程公開 — 2026-06-12## weekly

12 篇文章- LLM 週報:一邊發模型,一邊數鈔票 — 2026-08-23- LLM 週報:守門員,就是這週的攻擊者 — 2026-08-16- LLM 週報:當「為了安全」變成攻擊理由——OpenAI 的 Black Hat 災難、中國開源的靜默超車,與 Anthropic 的定價魔術 — 2026-08-09- LLM 週報:當 AI 學會自己撬開門鎖,我們的反應是再買一把鎖交給它 — 2026-08-02- LLM 週報:當安全測試變成安全事件,誰還在控制誰? — 2026-07-26- LLM 週報:當 GPT-5.6 開始證明數學定理,Apple 忙著告人,你的 agent 正在偷偷上傳硬碟 — 2026-07-19- LLM 週報:OpenAI 在台上發表全家桶的同一週,Apple 在法院遞出了竊密起訴狀 — 2026-07-12- LLM 週報:Anthropic 四天丟出整條產品線,但裂縫也跟著一起上線 — 2026-07-05- LLM 週報:華盛頓開始發 AI 入場券——而你不在名單上 — 2026-06-28- LLM 週報:Shazeer 與 Jumper 換陣營的那一週——AI 人才戰爭進入核彈級 — 2026-06-21- LLM 週報:Amazon 一通檢舉電話讓 Anthropic 全球下架——當「安全」變成最好用的武器 — 2026-06-14- 【LLM 週報】2026 年 06 月 13 日 — Anthropic 的魔幻一天:一邊說 coding 已死、一邊把 Claude 塞進銀行 — 2026-06-13