IA
为什么 AI 有时半天不开口,一开口却说得很快?
IA
本利行间 di Tingting & Josefina
Note sull'episodio
“这个模型很快”到底是什么意思?它可能是第一句话来得快,也可能是开口以后说得快;还可能只是平均速度漂亮,却经常让少数用户等得很久。
这一期用餐厅作比喻,拆开首 token 延迟、输出速度、端到端延迟、吞吐量和尾延迟,并解释为什么任何模型榜单都必须先问:测的是什么负载、上下文和服务条件?
时间戳:
- 00:00 开场:快,其实有好几种
- 01:23 第一口菜等多久:首 token 延迟
- 02:43 开口以后有多快:输出 token 速度
- 04:24 整顿饭吃多久:端到端延迟
- 05:43 一晚接多少桌:吞吐量
- 07:03 做完不算,按时做完才算:尾延迟
- 08:23 模型榜到底应该怎么看
本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。