大模型与 Agent 工程视频
每期讲清一个工程问题。数据来自实际测量,原理用动画拆开。
学习路径
展开收起
从第 1 期按顺序看,每期结尾都会接上下一期。
全部视频
共 9 期
第 9 期 · 性能与成本模型缩到三分之一,量化到底丢了什么同一个 Qwen3 1.7B,FP16、Q8_0、Q4_K_M 三个版本放在一起实测:量化怎样用更少的位记参数,文件大小怎么算出来,生成快了多少,答题变了多少。2026-10-08
第 8 期 · 模型基础同一个问题,为什么每次回答不一样用本地 Qwen3 1.7B 返回的概率表实测:模型每写一步,给出的是下一个 token 的概率表;采样按概率挑一个,所以回答会变;温度在挑之前改这张表。每个温度各问 100 次,看公式和实测对不对得上,以及温度 0 是不是每次都一样。2026-10-08
第 7 期 · 模型基础上下文窗口满了,会怎样用本地 Qwen3 1.7B 和云端 Claude Sonnet 5.5 实测:上下文窗口装的是什么;满了以后,本地 Ollama 默认读之前丢一次旧消息、写满了再丢一次,云端 Claude 直接报错;以及输入越长,为什么等得越久、花得越多。2026-10-08
第 6 期 · Agent 工程一个 Agent 任务,到底发了多少次请求回放一个真实的编程小任务:Agent 循环怎样一圈圈请求模型,每次的输入怎样像滚雪球一样变大,缓存省下了多少,循环又由谁来喊停。用 Claude Sonnet 5.5 实测。2026-10-08
第 5 期 · Agent 工程工具调用:模型自己不动手拆开一次真实的工具调用:模型只写调用请求,执行工具的是客户端,要让模型用上工具的结果,至少得请求它两次。用本地 Qwen3 1.7B 和 Claude Sonnet 5.5 实测。2026-10-08
第 4 期 · 性能与成本缓存命中,到底省了什么用本地的 Qwen3 1.7B 和云端的 Claude 实测前缀缓存:什么时候命中、什么时候失效,命中时省了多少时间和钱。2026-10-08
第 3 期 · 模型基础Token 到底是什么:怎么切、谁来切、怎么算钱用真实的分词器拆开 token:它是词表里的一块,不是一个字;同一段话换个分词器,token 数就变;输入和输出分开计价。2026-10-08
第 2 期 · 模型基础推理模型的“思考”:答案为什么晚到,账单为什么变多同一道鸡兔同笼题,用本地 Qwen3 1.7B 和 API 上的 Gemini 3.8 Flash 实测:推理模型先写草稿再答题,草稿怎样推迟答案的第一个字、让账单上的 token 变多,以及看不见草稿时,速度数字为什么不好算。2026-10-08
第 1 期 · 性能与成本大模型的快和慢:看懂 TTFT、TPOT 和 E2E用笔记本上的开源小模型实测:首字时间 TTFT、生成间隔 TPOT、端到端耗时 E2E 各是什么、由什么决定,以及它们怎么拼成一个式子。2026-10-07
没有找到匹配的视频。