为什么 AI 有时半天不开口,一开口却说得很快?
AI
为什么 AI 有时半天不开口,一开口却说得很快?
AI

本利行间 by Tingting & Josefina

Episode notes

“这个模型很快”到底是什么意思?它可能是第一句话来得快,也可能是开口以后说得快;还可能只是平均速度漂亮,却经常让少数用户等得很久。

这一期用餐厅作比喻,拆开首 token 延迟、输出速度、端到端延迟、吞吐量和尾延迟,并解释为什么任何模型榜单都必须先问:测的是什么负载、上下文和服务条件?

时间戳:

- 00:00 开场:快,其实有好几种

- 01:23 第一口菜等多久:首 token 延迟

- 02:43 开口以后有多快:输出 token 速度

- 04:24 整顿饭吃多久:端到端延迟

- 05:43 一晚接多少桌:吞吐量

- 07:03 做完不算,按时做完才算:尾延迟

- 08:23 模型榜到底应该怎么看

本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。