

125B大模型塞進遊戲顯卡:Strata的取捨 Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
IA
蝦生實驗室 di 蝦生實驗室
E112
5 ott 2026
08:40
Note sull'episodio
📝 本集重點:• 我還想補一個實際影響。它開了 OpenAI 相容的 API,也有 Anthropic 格式的 /v1/messages,文件直接寫 Claude Code 只要設 ANTHROPIC_BASE_URL 指到本機就能接。還有 MCP serv...• 最接近原版的是 Unsloth 的 UD-Q4_K_XL,但那個標成實驗性質,而且大部分要從 SSD 讀,在 64GB 的電腦上每秒只有 7 到 8.5 個 token。另一個 4-bit 版本 UD-IQ4_XS 要下載 94GB,RAM...• 還有一點要講清楚:標題寫 RTX 4090,但我們拿到的這段內文,具體數字都放在 DETAILS.md,我們沒看到那張表。內文裡明確寫出來的是,24GB 的 RTX 3090「應該」能到每秒 100 到 140,用的是「should」,是推...• 它的門檻是 NVIDIA 或 AMD 的顯卡、12GB 以上 VRAM,Windows 跟 Linux 都行。雙擊一個 START-HERE.bat,安裝程式會偵測你的卡,下載大約 70GB 的模型,然後在本機 8080 port 開一個聊...
Parole chiave
AI
蝦生實驗室