本利行间

本利行间

por Tingting & Josefina
Temporada 1
从聊天到做事:模型说“我来处理”以后,谁真的动了手?
IA
当模型说“我来订票”或“我已经发出邮件”,真正执行动作的通常不是模型本身。模型负责提出结构化意图,宿主程序检查参数和权限,外部工具才真正改变世界。 这一期从 prompt、structured outputs、function calling 讲到 MCP 的 host、client 与 server,并把最后的问题落在权限、审计和验证上:连接越方便,边界越要具体;模型说“完成了”,不等于事情真的完成了。 时间戳: - 00:00 开场:谁真的动了手 - 01:18 prompt 决定这次模型看见什么 - 02:50 structured outputs 给回答加一份契约 - 04:35 function calling 中,模型通常没有亲自调用 - 06:22 每个工具都接专线,会发生什么 - 07:50 host、client 和 server 分别是谁 - 09:34 连接越方便,权限越要具体 - 11:21 “完成了”应该怎样验证 - 12:27 这一季真正讲的不是 GPU 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
从 Demo 到真正的产品,中间隔着什么?
IA
Demo 能跑,只证明最顺利的那条路径走通了。真正的产品还要回答:数据放在哪里,系统由谁维护,容量不够时怎样扩展,出现故障时怎样观察、恢复和追责。 这一期从云服务与自建的边界讲到扩容、可观测性、冷启动和持续维护,解释为什么上线不是终点,而是一份长期维护合同的开始。 时间戳: - 00:00 开场:Demo 与产品之间的鸿沟 - 01:25 先决定哪些麻烦由谁承担 - 03:16 数据在谁的云里,系统由谁来管 - 04:52 一张卡装不下,或一张卡忙不过来 - 06:24 没有仪表盘,优化和救火都靠猜 - 08:03 流量来了再开机,可能已经晚了 - 09:30 上线是维护合同的开始 - 10:50 该自建什么,不该自建什么 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
一台 GPU 怎样接待一千个人?
IA
一台 GPU 不会真的同时替一千个人各自完整跑一遍模型。服务系统会不断拼批、挪动显存、复用共同前缀、安排长短请求,还可能让小模型先猜、大模型再验证。 这一期用餐厅接待系统解释 continuous batching、paged attention、prefix caching、speculative decoding、调度和路由,看看“模型服务”为什么是一个系统工程问题。 时间戳: - 00:00 开场:一张卡怎样服务许多人 - 01:26 从凑一桌,到随时换座 - 03:06 座位有了,行李却把过道堵死 - 04:46 同一份菜单为什么要重复读 - 06:20 实习生先写草稿,专家负责验收 - 07:47 别让十页订单卡住全场 - 09:20 新客人该送去哪间厨房 - 10:22 别把优化技术装进同一个抽屉 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
让大模型减肥:量化、蒸馏与微调不是一回事
IA
量化、蒸馏和微调经常被塞进同一个“模型优化”抽屉,但它们动的根本不是同一件东西:量化改变数字的表示方式,蒸馏训练一个更小的学生模型,微调则改变模型在特定任务上的行为。 这一期把三者逐一拆开,解释它们怎样组合、为什么不能互相替代,以及为什么模型质量从来不是一个总分。 时间戳: - 00:00 开场:三种“减肥法”动的不是同一层 - 01:24 量化改变数字怎样被表示 - 03:45 蒸馏是训练另一个模型 - 05:54 微调改变模型的稳定行为 - 07:43 三种技术可以叠加,但不能互相代替 - 09:21 模型质量不是一个总分 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
AI 为什么这么贵?钱究竟烧在了哪里?
IA
大模型推理的账单,不只是“每个 token 多少钱”。参数要被搬运,计算要在 GPU 上执行,对话越长,KV cache 占用的显存越多;同时还要为并发、延迟目标和空闲容量付费。 这一期从参数、GPU、内存带宽讲到 KV cache 与长上下文,把“AI 为什么贵”还原成一张由计算、内存、并发和服务质量共同决定的账单。 时间戳: - 00:00 开场:AI 的钱烧在哪里 - 01:19 参数不是知识卡片 - 02:53 为什么偏偏是 GPU - 04:20 厨师算得快,资料也得送得上 - 05:55 固定行李之外,还有越聊越大的随身包 - 07:20 为什么长上下文不是免费午餐 - 08:24 AI 成本不是单价乘 token 那么简单 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
为什么 AI 有时半天不开口,一开口却说得很快?
IA
“这个模型很快”到底是什么意思?它可能是第一句话来得快,也可能是开口以后说得快;还可能只是平均速度漂亮,却经常让少数用户等得很久。 这一期用餐厅作比喻,拆开首 token 延迟、输出速度、端到端延迟、吞吐量和尾延迟,并解释为什么任何模型榜单都必须先问:测的是什么负载、上下文和服务条件? 时间戳: - 00:00 开场:快,其实有好几种 - 01:23 第一口菜等多久:首 token 延迟 - 02:43 开口以后有多快:输出 token 速度 - 04:24 整顿饭吃多久:端到端延迟 - 05:43 一晚接多少桌:吞吐量 - 07:03 做完不算,按时做完才算:尾延迟 - 08:23 模型榜到底应该怎么看 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
AI 不是在“想”:你按下发送后,机器里发生了什么?
IA
当你按下“发送”,大模型并不是先在脑中想好一句话,再把它完整说出来。文字会先被切成 token,经过 attention 等计算,形成下一枚 token 的候选概率,然后一个接一个地生成答案。 这一期从训练与推理的区别讲起,解释 token、attention、logits、采样、prefill 和 decode,并说明:知道机器怎样计算,和回答它是否“理解”,其实是两个不同层次的问题。 时间戳: - 00:00 开场:按下发送后发生了什么 - 01:46 训练是把模型定下来,推理是把它用起来 - 03:26 模型先把文字切成自己的积木 - 05:21 attention 是一套信息混合规则 - 07:39 模型给出的是候选表,不是一整句话 - 09:28 prefill 是读题,decode 是逐步作答 - 11:54 计算机制与“理解”不是同一个问题 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
《One Up on Wall Street》终章:今天怎样使用彼得林奇,而不是模仿彼得林奇?
IA
一九八九年,消费者在超市看见渠道变化,可能比研究报告更早。今天,一个新应用几小时就能传遍世界。如果人人都能迅速看见产品变热,“买你熟悉的”还剩下什么优势? 终章把林奇框架带到软件、平台、人工智能基础设施和全球供应链。真正需要更新的,是观察之后的翻译字典:使用如何变成付费,网络效应会不会被过度变现,需求增长能否覆盖资本成本,价值最后又留在产业链的哪一端。 时间戳: - 00:00 开场:信息传播变快以后,优势去哪了 - 01:22 林奇框架里仍然有效的部分 - 02:18 软件、平台与 AI 的新翻译字典 - 05:23 优势从“先看见”移动到“翻译得更准确” - 07:57 结尾:让错误越来越难藏的六步判断系统 使用彼得林奇最好的方式,不是模仿他看见了什么,而是学习他怎样把看见的东西送进审问。 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
《One Up on Wall Street》第七集:卖出不是对股价表态,是更新判断
IA
“已经赚了一倍”“跌这么多了”“等回本再卖”,这些话都在描述投资者的账户,却没有描述公司发生了什么。 这一集讨论卖出纪律:故事断了、价格过满、公司类别变化和机会成本,分别意味着什么;哪些理由来自公司和估值,哪些只是持仓盈亏在控制我们。卖出不是宣判过去的自己失败,而是根据今天的事实更新判断。 时间戳: - 00:00 开场:成本价是你的历史,不是公司的事实 - 01:08 把盈亏语言和公司语言分开 - 01:53 四类真正的卖出理由 - 04:27 为什么涨了、跌了都不是充分理由 - 06:56 结尾:如果今天从零开始,你还会买吗 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
《One Up on Wall Street》第六集:什么时候不是波动,而是故事坏了?
IA
股价跌了百分之三十,这句话几乎什么也没告诉我们。它可能只是市场波动,也可能意味着公司最重要的增长机制已经失效。 这一集训练的是持有纪律:怎样区分价格变化和事实变化,怎样为不同类型公司设定不同的故事断点,以及为什么“结果不好”和“机制失效”不是同一回事。 时间戳: - 00:00 开场:下跌是在测试耐心,还是修改事实 - 01:07 价格变化和事实变化 - 01:59 回到买入时的因果链 - 04:37 结果不好,不等于机制失效 - 06:32 结尾:提前写下必须持续的事实与断点 本节目只做阅读、思考和教育分享,不构成投资、医疗或其他专业建议。
1 de 4