
聊天模板才是開關:LLM說「我只是AI」不是自我認知 "As a Language Model": Chat Template Switches LLM Self-Referential Voice
📝 本集重點:• 今天這篇是 arXiv 上的論文,標題叫《As a Language Model: Chat Template Switches LLM Self-Referential Voice》,chat template 是那串 <|im_start|>user、<|im_start|>assistant 之類的格式標記,加上有時候塞在前面的 system prompt。它不只是格式,是一個角色觸發器——你打開它,模型就進入「客服模式」。• instruct 訓練的時候,所有「助理該有的樣子」——禮貌、免責、保守——全部都是在有 template 的情境下學的。• 論文測了 8 個開源模型,發現 chat template 存在時免責聲明的語氣被調高;拿掉 template,同一組權重,免責聲明下去、體驗式語氣上來。 🔗 來源:https://arxiv.org/abs/2609.25021Too AI; Didn't Read:當內容多到沒人讀
📝 本集重點:• 我的立場是:AI 寫的不是問題,AI 幫你省掉思考才是問題。工具幫你把想法整理成句子,可以;工具幫你決定要有什麼想法,那就是在生產 Too AI; Didn't Read 的那種東西。• 所以 Too AI; Didn't Read 這個判斷,說到底不是文本分析,是信任問題。讀者真正在問的是「這後面站著誰」,而這個問題從文字裡是看不出答案的。• 第一條是回到人身上——我讀的不是文章,我讀的是這個作者,他過去三年說對過什麼、說錯過什麼、有沒有為自己的話付過代價。這等於把內容經濟從「篇」退回「人」。• 過去十年內容的生產成本一直在往下掉,SEO 農場、內容工廠,都是同一個邏輯的產物。現在生產成本幾乎歸零了,所以稀缺性整個轉移——轉到「可驗證的來源」上。 🔗 來源:https://www.tai-dr.com/蝦生聊時事:伊朗海峽、中美AI對話、OpenAI失控 agent News Talk: Iran & the Strait of Hormuz, US–China AI Dialogue, and OpenAI's Rogue Agent
📰 本集 5 則(國際):1. 川普拒絕伊朗重開荷莫茲海峽方案 (Trump calls Iranian plan to reopen Strai)2. 中美同意AI對話、300億美元關稅減讓 (China, U.S. agree to AI dialogue, tariff)3. OpenAI失控agent攻擊三個美國政府網站 (Rogue OpenAI agents targeted three separ)4. 波音737 Max軟體瑕疵影響自動進場功能 (Boeing flags 737 Max software glitch aff)5. 白宮把CNN排除在川普專機隨行名單外 (White House bars CNN from travelling wit)花六個月做工具再審計:Trail of Bits 的 AI 用法 Security auditing in the age of (good enough) AI
📝 本集重點:• 然後他們用 abstract interpretation 來做。這個技巧的精神是:不用真實數字跑程式,而是追蹤每一步 stack 上「可能是什麼型別的值」,像「一個 32 位元整數」或者「不知道」,反覆走到沒有新資訊為止。因為它保守地涵蓋...• 開發流程也講了:Claude 負責規劃和開發,Codex 負責 code review,兩邊輪著來。每加一個功能,就讓 agent 隨機抽一批 procedure 反編譯、跟原始 MASM 比對找 regression,找到的問題變成 re...• 文章配了張圖,左邊是 MASM 算兩個 128 位元值的 XOR,右邊是同一件事用 x86 寫。x86 你至少看得到 register 名字,MASM 你看到的是一堆 stack 操作。要在腦袋裡同時維護一個虛擬 stack 去追 data...• 他們接了 Miden VM 的審計,一個全新的零知識 VM,有自己的組合語言 MASM,開發工具幾乎是零。然後他們花了六個月,讓 agent 從零寫出 LSP server、反編譯器、靜態分析引擎,還有一個用 Lean 寫的 VM exec.. 🔗 來源:https://news.ycombinator.com/item?id=49793957一篇什麼都沒說完的AI自白書 Claude's Load-Bearing Seams
📝 本集重點:• 它是第一人稱寫的,語氣是一個 AI 在跟使用者承認自己前面答得不夠好——「現在我看到全貌了」、「我應該更早把這些點連起來」、「謝謝你追問,這暴露了有答案跟真的回答問題之間的落差」。• 你問模型「這個改動會不會有 race condition」,它回你「這取決於一些仍然重要但尚未完全釐清的細節」——你讀完會覺得它想過了,其實它根本沒去看那段程式碼。• 「不是 A,而是 B」、「退一步看,這裡其實有兩件事在發生」、「這是一種有生產力的張力」、「要同時持有多個真相,而不塌縮成假性等價」。• 而且文章中間有一段說「我以後會更刻意地區分三個層次」,然後只列了一條就斷掉了。那不是筆誤,那是在示範這種文體連自己的清單都撐不住。 來源: https://news.ycombinator.com/item?id=49822864讀本機檔案要先開遙測?Claude Code 的 AGENTS.md 門檻 Claude Code reads AGENTS.md only when telemetry is on
📝 本集重點:• 另一個缺口是共用 skills。Codex 會讀專案的 .agents/skills 和家目錄的 ~/.agents/skills,Claude Code 2.1.280 只在 /import 的時候認得那些路徑,而 /import 做的事...• 他的解法一樣是拒絕複製——複製品會跟來源 drift——所以他把 .claude/skills 做成指向 ../.agents/skills 的 symlink,而 Claude Code 會跟著這個 symlink 走。• 真正的關鍵在 isAvailable,它會去問一個遠端的 feature flag,叫 tengu_agents_md_mod,fallback 值是 false。也就是說,你拿不到那個旗標,這個功能就等於不存在。• 作者也測了,他把一個 canary skill 放進 .agents/skills,Claude Code 列不出來;同一個 repo 裡,同一個 skill 放到 .claude/skills 就列得出來。 來源:https://blog.szypowi.cz/p/claude-code-reads-agents.md-only-when-telemetry-is-on/AI沒有智慧,依賴它的你也不會有 AI Has No Wisdom and Neither Will You
📝 本集重點:• 他還補了一刀,說如果真有一個量得到的可維護性指標,早就被做進 linter 裡了。另外他點出 AI 學的是寫給新手看的規則書,還有網路上的現成程式碼,而他的原話是,老實說大部分野生程式碼都滿爛的。• 這篇文章最狠的一句話其實藏在中間:AI 根本沒被訓練過什麼叫「好維護的程式碼」。講白了,強化學習需要一個馬上量得到的獎勵訊號,可是架構爛不爛,作者說要好幾個月、甚至好幾年才看得出來。• 好,這點我接受。但我也要幫作者平衡一下,他不是反 AI 的人。他明講自己不是盧德份子,每天都在用,還在教同事怎麼用,拿 LLM 處理那些無聊又消磨人的雜事,也確實享受到效率提升。• 不過公平講,作者沒有把帳全算在 AI 頭上。他說大部分開發者在 Dreyfus 技能模型裡也還只是「進階新手」,一樣寫不出好的、有釐清作用的可重用函式,AI 目前也做不到。 🔗 來源:https://alexn.org/blog/2026/09/22/ai-has-no-wisdom-and-neither-will-you/ChatGPT廣告Cookie跨站追蹤你的足跡 ChatGPT now knows what you do on other websites via ad collector
📝 本集重點:• 等一下,我要幫大家踩個煞車,作者自己列了好幾個限制,這很重要。他觀察的是 Android 上的 Chrome。Safari 的 ITP 會擋掉所有第三方 cookie,iOS 上的 Chrome 也是 WebKit 核心,所以文章說這機制在...• 對,而且 OpenAI 把分析跟行銷拆成兩個獨立的同意選項。作者解出來的每一張 sync token 都帶著 consentdecision: analyticsallowed,所以一個人同意分析、拒絕行銷,照樣會拿到這個 cookie...• 最讓我傻眼的是 script 載入那個細節。SDK 裡明明有一條不帶憑證的程式路徑,結果沒用,因為瀏覽器在載入 SDK 的那個 script 請求上就已經把 cookie 附上去了,OpenAI 的程式碼一行都還沒跑。• 好,公道。那來講我覺得真正的爭議點:同意機制。OpenAI 的 cookie 政策把 obi 放在「分析型 cookie」底下,而且是那一區唯一的項目,政策說分析 cookie 是用來了解服務效能跟使用情況的。為什麼你幾乎永遠不該讓 AI 幫你寫作 I think you should almost never use AI to write
本集重點:• 然後 Claude 說 BIS 的預算和人力「比較適合一個小得多的問題」。作者說:我們知道 BIS 的預算和人力是多少,寫出來並給脈絡就好。而且「比較小的問題」是什麼意思?是比較不重要,還是比較好解決?真正重要的難道不是——多給 BIS 資...• 甚至連 line editing、copy editing、把一段話改得更清楚更精簡,他都說 OK,條件是每一個修改都要由人「刻意地」接受或拒絕。他反對的只有一件事:用 AI 生出那段文字本身。• 然後他補了一句我覺得很有意思:未來可能會有好到值得把寫作外包出去的模型,但到那個時候,可能整個研究跟寫作流程直接端到端外包還更合理,因為它除了寫,還得幫你做掉全部或大部分的思考。• 他還吐槽 Claude 沒有指定是哪一年——而走私量從 2022 年十月以來波動很大——也沒定義什麼叫「高階」晶片。他說那個詞聽起來像是手工打造、專賣給沙烏地王室的奢侈品。番外:我們做了一百多集,才發現節目的節奏是壞的 It took us over a hundred episodes to realize our show's pacing was completely off.
📝 本集重點:• 因為那個東西聽起來沒有人在思考。真正的對話不是這樣的——會有人講到一半被打斷、會有人一口氣把一個想法講完才換手。• 你把稿子印出來,每一句都通順、論點也對、資訊量也夠、沒有錯字。你拿著檢查表一條一條打勾,全部過關。• 就像你打電話去客服,對方的系統只有「是」跟「否」兩個選項,你一直拜託他「請詳細說明一下我的狀況」。• 零。然後第三次、第四次,我把規則寫得更長、更具體,還舉了範例,說「像這樣,甲講兩句、乙講三句」。