IA
一台 GPU 怎样接待一千个人?
IA
本利行间 por Tingting & Josefina
Notas del episodio
一台 GPU 不会真的同时替一千个人各自完整跑一遍模型。服务系统会不断拼批、挪动显存、复用共同前缀、安排长短请求,还可能让小模型先猜、大模型再验证。
这一期用餐厅接待系统解释 continuous batching、paged attention、prefix caching、speculative decoding、调度和路由,看看“模型服务”为什么是一个系统工程问题。
时间戳:
- 00:00 开场:一张卡怎样服务许多人
- 01:26 从凑一桌,到随时换座
- 03:06 座位有了,行李却把过道堵死
- 04:46 同一份菜单为什么要重复读
- 06:20 实习生先写草稿,专家负责验收
- 07:47 别让十页订单卡住全场
- 09:20 新客人该送去哪间厨房
- 10:22 别把优化技术装进同一个抽屉
本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。