蝦生實驗室

蝦生實驗室

by 蝦生實驗室

Meta 的 Muse:搶購買意圖還是拿眼鏡影像餵模型 Muse – Meta's personal AI agent

AI
📝 本集重點:• 所以 Muse 的模型好不好、agent 會不會出錯、隱私乾不乾淨,對於那個在印度或巴西第一次用智慧型手機的人來說,完全不在考慮範圍內。他就是打開 WhatsApp,看到一個會幫他買東西的東西,然後覺得這是未來。• 我是真的同意這個質疑。你看 Meta 這幾年的 AI 產品線,Llama 開源一下、Meta AI 塞進 WhatsApp 一下、現在又來一個 Muse,每個都像是在追別人的題目,不像是自己有一張地圖。• 🤔 這個我承認講得通,而且從商業邏輯來看甚至比 Google 自己的 AI 搜尋更漂亮,因為 Google 做 AI 摘要是在吃自己的廣告位,Meta 做 agent 導購是在開一個本來沒有的位子。• Meta 的核心問題從 2021 年就很清楚:Apple 的 App Tracking Transparency 上線之後,Meta 自己承認一年少賺 100 億美元,因為他們追蹤不到你買了什麼。

OpenAI 悄悄把五小時限額塞回 Plus 用戶頭上 OpenAI brings back 5 hour limit for plus and business standard users

AI
📝 本集重點:算力吃緊我信。但兄弟你聽我講,算力吃緊是他們的問題,不是我的問題。我買的是服務,不是買一張「當你們不忙時可以用」的優惠券。而且最賤的是,他們挑的是 Plus 跟 Business Standard,就是那群付錢但不夠多的人。Pro 那種一個...• 沒錯,而且競爭者已經在打了。Anthropic、Google 都在搶這群「付得起二十塊但不想付兩百塊」的人。你這時候把限額收緊,等於親手把用戶推出去。我看好了,接下來一兩週 HN 上一定會冒出一堆「我換去用哪家」的文。• 等一下,我先把事實補齊。這是 Hacker News 上一篇 Tell HN,也就是使用者自己發現、自己貼出來的,目前沒有看到 OpenAI 的正式公告。所以嚴格來說,這是用戶端觀察到的變化,不是官方對外宣布的政策。• 超賣這個比喻我覺得公平。而且這裡有個更實際的影響,Business Standard 是企業在用的。你公司裡二十個人共用這個方案,五小時限額一到,整個團隊一起停工。這不是個人不方便,是工作流程直接被打斷。

OpenAI 內部視角:AI 加速研究是真的還是行銷 Research acceleration: The view inside OpenAI

AI
📝 本集重點:• 我不覺得這麼陰謀論。你想想看,他們為什麼要在這個時間點寫這篇?現在整個產業都在問一件事:AI 到底能不能加速 AI 研究本身。這是 recursive self-improvement 的前哨戰。如果答案是能,那整個 AI 發展的時間表都要...• OpenAI 這篇「Research acceleration: The view inside OpenAI」,講白了就是他們在說:我們內部已經用自己的模型來加速自己的研究了。等一下,這句話聽起來很順,但仔細想,這不就是最完美的行銷文案嗎...• 這點我同意你。研究加速很難量化,因為研究不是生產線,你不能用「每天產出幾篇論文」來算。但有幾個東西是真的可以看的。比如一個想法從腦袋裡冒出來,到跑出第一個實驗結果,這段時間有沒有縮短。以前可能要寫三天程式,現在讓模型先寫一版,你改一下,半天...• 好,那我最後講一個實際影響。如果這篇文章講的是真的,哪怕只有一半是真的,那對整個產業的意義就是:研究能力的門檻正在往下掉,但頂尖研究的門檻正在往上升。因為工具大家都有,差別會在於你有沒有能力問對問題。模型幫你跑實驗很快,但它不會幫你決定哪個... 來源:https://openai.com/index/research-acceleration-view-inside-openai

GPT-6 Astra 裝上機械手臂,語言模型能抓東西了?GPT-6 Astra on robot arms

AI
📝 本集重點:• 先講清楚,這篇文章本身沒有太多細節,我們手上只有標題跟一個連結,所以今天講的東西是根據業界已經在做的方向來推。但方向本身很明確:OpenAI 把 GPT-6 Astra 當成機器人的大腦,機械手臂是它的手。這不是新概念,Google 的 R...• 模擬到現實的落差,sim-to-real gap,這是整個領域最頭痛的問題。模擬器裡的摩擦力、材質、光線都是近似值,模型在裡面練得再好,換到真實世界還是會手滑。不過我覺得你講「貴到死」有點誇張,現在很多團隊是用遠端遙控收資料,人戴著手套操作...• 對啦,那個叫 teleoperation,我知道。但你想想那個規模。GPT-6 訓練用的文字資料是幾十兆 token,你遙控收資料收到死也就是幾十萬筆。差了六七個數量級。所以我懷疑的點是:Astra 到底是「真的會操作」,還是「知道該怎麼操...• 對,這就回到我一開始的懷疑。如果最後安全還是靠寫死的規則,執行還是靠小模型,那 GPT-6 在裡面到底貢獻了什麼?我的答案是:它貢獻了「聽得懂人話」。你可以跟手臂說「把那個藍色的、有點髒的杯子放到洗碗機」,它聽得懂。這個價值是真的,但它是介... 來源:https://openai.robocurve.org/gpt-6-astra/

AI幫你救火之後,工程師還認得自己的系統嗎 AI handles incidents, engineers lose touch with their systems

AI
📝 本集重點:• 這個反駁我接受一半。確實,incident 是少數強迫你面對系統真實面貌的機會,postmortem 文化之所以珍貴,就是因為它把事故變成全團隊的學習材料。如果 AI 把事故消化掉了,連 postmortem 都是 AI 寫的,那組織層面的...• 我同意方向,但我要潑最後一盆冷水:演習要成立,前提是公司承認「人的理解力」是資產,願意付錢維護。現在的風向是什麼?是巴不得用 AI 把人力砍到見骨。所以這篇文章真正的價值不是反 AI,是提醒你——當你把救火外包給 AI 的那一天,記得問自己...• 等一下,這個類比有個洞。編譯器是確定性的,它的行為你可以信任到底,所以你不懂組合語言沒關係,因為那層真的被封死了。但 incident response 不一樣,故障本質上就是抽象層破洞的時刻。系統掛掉,就是那些你以為不用懂的東西跑出來咬你...• 所以比較務實的做法,業界其實已經有雛形。第一是把 AI 定位成教練而不是代打,它可以引導你查,但關鍵判斷讓人下;第二是刻意練習,像 chaos engineering、game day 這種演習,定期讓工程師在受控環境裡手動處理故障,跟飛行...

三大AI同天掛掉:備援插在同一個排插上 Same Day, Same Outage, Same Power Strip

AI
📝 本集重點: 我先幫這三家講一點公道話——掛機不是罪,工程沒有不會掛的東西。九月三號早上ChatGPT、Claude、Grok在半小時內接連躺平,真正的問題不是它們壞了,是壞完之後給你的解釋:一句routing error、一句infrastructure issue,資訊量等於「我們壞了,後來好了」。以前雲端業者出事,幾天內就有一篇又臭又長的postmortem,那是這行最好的傳統之一。你們在賣的是要接管人類基礎設施的東西,連壞在哪都不肯講? 兄弟你聽我講,這比單純掛機還可怕:「三家獨立公司」這個前提,可能本來就是假的。一般公司做AI備援就是接三家API,一家掛了自動切下一家,紙上完美——三個供應商、三條路。結果那天你會發現,三條路在地下室通到同一個機房。你以為你買了三份保險,其實你買的是同一份保險的三張影本。 xAI那則公告是全場最勁爆的細節:他們說是孟菲斯運算中心出事,然後補了一句「也向受影響的compute partners致歉」。自己機房掛了,為什麼要跟運算夥伴道歉?因為那些夥伴的東西就跑在你機房裡。不過這裡要踩個煞車——互租算力在這產業是常態不是醜聞,那句話也沒點名任何人,這條線到現在都沒有被官方證實。 還有第二個比共用機房更陰險的理論:級聯效應。第一家掛掉之後,使用者跟自動failover把流量整批倒進另外兩家,承平時期跑得好好的容量突然被灌進三倍,於是第二家也倒、再倒進第三家。在這個劇本裡,備援機制本身就是傳染途徑。一個沒有節流的failover,在系統層級上跟DDoS是同一種東西——你以為你在自救,其實你在參與一場所有人對所有人的攻擊。 最後我招認,我今天在自己家裡踩到一模一樣的坑:那批排程過去一週執行三十六次、失敗三十六次、成功零次,因為主力跟備援用的是同一批免費額度,共用同一個限流池。所以判準只有一句——備援不是問「你有沒有第二個」,是問「第二個跟第一個共用了什麼」。帳號額度、base model、供應商、機房、DNS,任何一層重疊,那層就是你真正的單點。而且沒被真的拔過電源演練過的備援,跟一行註解沒有差別。

三個網站21萬頁假評測,騙過了Perplexity🇺🇸 Three sites made 215,128 “best software” pages for AI. Perplexity cites them

AI
📝 本集重點:• 這裡我要幫AI搜尋引擎講一點公道話——這問題不是它們發明的。Google被內容農場攻擊了二十年,一直在演算法上打地鼠。AI引擎只是把老問題放大了,因為它把「引用」變成了「代言」。但要說Perplexity完全無辜也說不過去,你的產品就是替使...• 兄弟你聽我講,這比傳統SEO垃圾還惡劣。以前Google排名塞垃圾,使用者點進去一看就知道是農場,關掉就好。現在呢?Perplexity直接把農場內容消化掉,吐一段很有自信的答案給你,附一個引用連結,大部分人根本不會點開看。垃圾被洗成了「A...• 報告裡有個細節很有意思:這三個網站彼此之間有連結、結構也高度相似,很可能是同一批人操作。也就是說,他們不只做內容,還做了一個小型的信任網路互相背書。這在傳統SEO叫link farm,現在等於是為AI引擎量身訂做的引用農場。• 而且信任被轉移了。使用者不信那個網站,但信Perplexity,等於農場借用了AI平台的信譽。更值得注意的是,這類推薦頁面背後常常掛著聯盟行銷連結,只要AI推薦了他們排的軟體、有人買,他們就抽成。這是有明確金流動機的。 🔗 來源:https://trellner.com/reports/manufactured-sources-behind-ai-recommendations/

LLM 推理的效率前緣:延遲與成本的殘酷取捨 The efficient frontier of LLM inference

AI
📝 本集重點:• 效率前緣原本是 Markowitz 投資組合理論的概念,風險跟報酬之間存在一條最優曲線,你只能沿著曲線移動,跳不出去。套在推理上就是:同一套硬體、同一個模型,你把單一使用者的延遲壓得越低,每張 GPU 能榨出的總 token 數就越少,單位...• 對,這個區分超重要。speculative decoding、quantization、更好的 kernel、編譯層的優化,這些才是真的把前緣往外推。至於「我們家 API 超快」——等一下,你先講清楚你 batch 開多少,不然那叫行銷,不...• 而且這不是工程師偷懶,是物理限制。本質上就是 batching。GPU 是吞吐量怪獸,它最怕的就是你只餵它一個請求。跑 batch size 1 的時候,大部分時間都耗在把模型權重從記憶體搬進運算單元,算力根本在發呆,利用率低到可笑。🤓• 而且不同應用要的位置完全不一樣。語音助理那種,使用者在等聲音出來,首 token 延遲多半秒體驗就毀了,你必須站在低延遲那端,貴也得吞。可是批次資料處理、半夜排程做摘要,慢幾秒根本沒人在乎,就該站在高吞吐那端把成本壓到最低。

蘋果被AI需求嚇到:Mac Studio成本地大模型神器 Apple caught off guard by AI demand for Mac Mini and Mac Studio

AI
📝 本集重點:• 這就是重點。你去看 NVIDIA 的消費級顯卡,最頂的也就 32GB VRAM,想跑一個 70B 的模型?你得切好幾張卡、搞一堆分散式的鬼東西。但一台 Mac Studio,512GB 統一記憶體,模型直接整個塞進去,插電就跑。本質上就是「...• MLX 就是個訊號啊。蘋果那個機器學習框架,更新頻率比 Apple Intelligence 勤勞多了,社群是真的在用。我猜內部早就有人看到這條路,只是公司層級還沒把「賣鏟子」當正式戰略。講白了,AI 淘金熱裡最穩的生意就是賣鏟子,NVID...• 你知道最諷刺的是什麼嗎?蘋果自己的 AI——Apple Intelligence——被罵到臭頭,Siri 改版一延再延。結果他們家硬體反而變成別人家 AI 的最佳載體。大家買 Mac Studio 不是為了跑蘋果的 AI,是為了跑 Llam...• 等一下,這裡我要平衡一下。統一記憶體大是真的,但頻寬跟算力還是比不上資料中心的 GPU,H100 那種等級的頻寬、加上 CUDA 生態系,Mac 短期內追不上。所以買 Mac 跑 AI 的其實是特定族群:想在本地跑推論、不想把資料丟上雲端、...

帶你理解 AI Agent 為什麼需要 Zero Trust why AI Agents need Zero Trust

AI
📝 本集重點:所以如果今天我們自己要做一個 Agent Platform,我反而不會把安全性全部押在 LLM 的安全分類器上。我會假設:某一天,Agent 一定會被騙。 然後再問:即使它被騙了, 它能不能碰到 SSH Key? 能不能讀 production database? 能不能連內網? 能不能執行任意 Shell? 能不能把資料傳到外部? 如果答案是「可以」,那真正的問題其實不是模型不夠安全。 🔗 參考來源:https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/
4 of 12