返回主页

讲义与导论

实践主线

课程项目优先来自 vLLM-HUST、vLLM-Ascend-HUST、vLLM-HUST benchmark、dev-hub 等真实仓库的 issue、PR 需求、benchmark 缺口和文档改进任务。学生以 2-3 人为一组,完成 issue 分析、代码路径说明、实验脚本、测试结果、PR 链接或 patch、review 处理记录。评价重点不是孤立 demo,而是是否进入真实开发流程,是否能解释系统瓶颈和代码路径,是否有可复现实验,是否遵守开源协作和工程规范。

近期系统优化案例库

2026 年课程也会逐步吸收当前大模型推理系统优化工作中的公开可讲案例。这里的目的不是把研究仓库直接变成作业答案,而是把真实系统问题转化为学生能分析、复现和汇报的课程任务。

研究线索 可讲的系统问题 适合放入的课程环节
adaptive decode backend selection 不同 decode 后端在 workload、模型和硬件条件下的适用边界,以及为什么端到端收益必须用真实请求路径验证 第 8 讲执行优化、第 11 讲实验方法
KV plane / agent state agent 类请求如何带来跨步骤状态、KV 生命周期和共享状态管理问题 第 5 讲 KV 缓存、第 6 讲状态管理
segment reuse / prefix sharing 相似上下文、system prompt 和文档片段能否转化为真实 runtime reuse,而不是只停留在 overlap 统计 第 5 讲 KV 缓存、第 10 讲论文比较
KV-Delta 迁移 KV 时为什么全量搬运、增量搬运和重新 prefill 代表不同的系统 contract 第 6 讲状态管理、第 11 讲实验方法
tiered KV cache KV 在显存、主机内存和潜在外部介质之间移动时,延迟、容量和调度决策如何耦合 第 5 讲 KV 缓存、第 8 讲执行优化
MLP materialization / small GEMM 异构硬件上算子路径、shape、graph capture 和 kernel fallback 如何影响实验可信度 第 8 讲执行优化、第 9 讲异构平台适配
data-parallel locality prefill / decode 分离和多卡拓扑下,放置决策为什么会影响 tail latency 和资源利用率 第 4 讲请求调度、第 9 讲异构平台适配
workflow-compliant optimization repo 一个优化想法如何从问题定义、runtime 边界、专用环境、workload 来源和证据标签组织成可复现研究 artifact 第 12 讲开源系统实践、第 13 讲课程项目工作坊

课堂使用时,每个案例都应先回答四个问题:观察到的系统现象是什么,涉及哪条 runtime 或实验路径,最小可复现实验是什么,已有证据能支持什么结论、不能支持什么结论。对于尚未完成端到端验证的优化,只作为问题分析或实验设计案例,不写成已证明的性能收益。

Tutorials

实验单与项目说明