大模型与 Agent 工程视频
每期讲清一个工程问题。数据来自实际测量,原理用动画拆开。
学习路径
从第 1 期按顺序看,每期结尾都会接上下一期。
全部视频
共 5 期
第 5 期 · Agent 工程工具调用:模型自己不动手拆开一次真实的工具调用:模型只写调用请求,执行工具的是客户端,要让模型用上工具的结果,至少得请求它两次。用本地 Qwen3 1.7B 和 Claude Sonnet 5.5 实测。6:05 · 2026-10-08
第 4 期 · 性能与成本缓存命中,到底省了什么用本地的 Qwen3 1.7B 和云端的 Claude 实测前缀缓存:什么时候命中、什么时候失效,命中时省了多少时间和钱。5:11 · 2026-10-08
第 3 期 · 模型基础Token 到底是什么:怎么切、谁来切、怎么算钱用真实的分词器拆开 token:它是词表里的一块,不是一个字;同一段话换个分词器,token 数就变;输入和输出分开计价。6:36 · 2026-10-08
第 2 期 · 模型基础推理模型的“思考”:答案为什么晚到,账单为什么变多同一道鸡兔同笼题,用本地 Qwen3 1.7B 和 API 上的 Gemini 3.8 Flash 实测:推理模型先写草稿再答题,草稿怎样推迟答案的第一个字、让账单上的 token 变多,以及看不见草稿时,速度数字为什么不好算。5:24 · 2026-10-08
第 1 期 · 性能与成本大模型的快和慢:看懂 TTFT、TPOT 和 E2E用笔记本上的开源小模型实测:首字时间 TTFT、生成间隔 TPOT、端到端耗时 E2E 各是什么、由什么决定,以及它们怎么拼成一个式子。4:18 · 2026-10-07
没有找到匹配的视频。