大模型与 Agent 工程视频
每期讲清一个工程问题。数据来自实际测量,原理用动画拆开。
学习路径
展开收起
从第 1 期按顺序看,每期结尾都会接上下一期。
全部视频
共 13 期
第 13 期 · 模型基础模型怎么查资料,又会在哪儿查错用本地的两个小模型实测:Embedding 把一段话变成 1024 个数,意思相近的离得近;在一本虚构的员工手册上按问题找出最相近的 3 段,交给 Qwen3.5 4B 回答,对比不查资料时的回答;再看这个小 Embedding 模型在编号上为什么只领先一点点,关键词检索和混合检索怎么补,以及检索拿错段时模型会怎样。2026-10-08
第 12 期 · Agent 工程Agent 读到的一句话,为什么能让它去做错事用本地 Qwen3.5 4B 和两个假工具实测提示注入:报价单里藏一句话,让 Agent 把内部预算发给供应商。每种设置跑 30 遍,看提示词防护能降多少、能不能降到零,再看动作这一层的确认和最小权限。2026-10-08
第 11 期 · Agent 工程说了只输出 JSON,模型为什么还会写错用本地 qwen3.5 4B 实测同一个抽取任务的三种做法:只靠提示词(再试一版写明“一个 JSON 对象”的提示词)、JSON 模式、按 JSON Schema 约束,各跑 80 次,数清解析失败、格式不符和内容错误各有多少;再看约束解码怎样在每一步划掉不合规的 token,以及它管不了的两件事:内容对不对、有没有写完。2026-10-08
第 10 期 · 模型基础用 Ollama,在自己的电脑上把模型跑起来用 qwen3.5:4b 在本机实测:Ollama 把模型文件下到硬盘,在本机开一个 HTTP 服务;拉取、运行、查看占用,模型名和标签怎么读,第一次请求为什么慢,从代码里怎么调用,占多少内存,以及它默认只在本机监听、没有鉴权。2026-10-08
第 9 期 · 性能与成本模型缩到三分之一,量化到底丢了什么同一个 Qwen3 1.7B,FP16、Q8_0、Q4_K_M 三个版本放在一起实测:量化怎样用更少的位记参数,文件大小怎么算出来,生成快了多少,答题变了多少。2026-10-08
第 8 期 · 模型基础同一个问题,为什么每次回答不一样用本地 Qwen3 1.7B 返回的概率表实测:模型每写一步,给出的是下一个 token 的概率表;采样按概率挑一个,所以回答会变;温度在挑之前改这张表。每个温度各问 100 次,看公式和实测对不对得上,以及温度 0 是不是每次都一样。2026-10-08
第 7 期 · 模型基础上下文窗口满了,会怎样用本地 Qwen3 1.7B 和云端 Claude Sonnet 5.5 实测:上下文窗口装的是什么;满了以后,本地 Ollama 默认读之前丢一次旧消息、写满了再丢一次,云端 Claude 直接报错;以及输入越长,为什么等得越久、花得越多。2026-10-08
第 6 期 · Agent 工程一个 Agent 任务,到底发了多少次请求回放一个真实的编程小任务:Agent 循环怎样一圈圈请求模型,每次的输入怎样像滚雪球一样变大,缓存省下了多少,循环又由谁来喊停。用 Claude Sonnet 5.5 实测。2026-10-08
第 5 期 · Agent 工程工具调用:模型自己不动手拆开一次真实的工具调用:模型只写调用请求,执行工具的是客户端,要让模型用上工具的结果,至少得请求它两次。用本地 Qwen3 1.7B 和 Claude Sonnet 5.5 实测。2026-10-08
第 4 期 · 性能与成本缓存命中,到底省了什么用本地的 Qwen3 1.7B 和云端的 Claude 实测前缀缓存:什么时候命中、什么时候失效,命中时省了多少时间和钱。2026-10-08
第 3 期 · 模型基础Token 到底是什么:怎么切、谁来切、怎么算钱用真实的分词器拆开 token:它是词表里的一块,不是一个字;同一段话换个分词器,token 数就变;输入和输出分开计价。2026-10-08
第 2 期 · 模型基础推理模型的“思考”:答案为什么晚到,账单为什么变多同一道鸡兔同笼题,用本地 Qwen3 1.7B 和 API 上的 Gemini 3.8 Flash 实测:推理模型先写草稿再答题,草稿怎样推迟答案的第一个字、让账单上的 token 变多,以及看不见草稿时,速度数字为什么不好算。2026-10-08
第 1 期 · 性能与成本大模型的快和慢:看懂 TTFT、TPOT 和 E2E用笔记本上的开源小模型实测:首字时间 TTFT、生成间隔 TPOT、端到端耗时 E2E 各是什么、由什么决定,以及它们怎么拼成一个式子。2026-10-07
没有找到匹配的视频。