Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

llama 相关 PR

2026-08-17
测试 重要性 7.40 洞察度 5.00

合并多项池化测试启动,减少约 53 次 runner 启动

值得测试相关的工程师精读,特别是 `test_colpali.py` 的 `test_colpali_default_runner` 聚合模式、`test_colqwen3_5.py` 的 module fixture 模式,以及 `test_awq.py` 把参数化改为循环的手法。可作为 vLLM 测试套件中「减少 runner 启动」系列重构的参考实现。若需进一步优化,可考虑为共享 fixture 增加失败隔离(如按 fixture 分组标记)并保留异常消息断言。

2026-08-03
缺陷修复 重要性 3.65 洞察度 3.00

修复 Llama70B TP4 基准静默跑成 TP1

值得快速浏览而非精读:它是一行配置修复,但对性能基准数据的可信度有直接影响,适合负责性能监控与 CI 基准的工程师关注。核心启示是 merge_serving_tests_stream 的 defaults 合并语义——缺省字段静默继承——是配置“看起来对、实际错”的温床;建议顺手审计同文件其他条目,并在 run-performance-benchmarks.sh 侧增加合并后字段完整性断言,把这类问题从“人工发现”变成“自动拦截”。

2026-07-16
缺陷修复 重要性 5.59 洞察度 4.00

修复 EAGLE3 第一层 qkv_proj 前缀缺失层名问题

值得立即合并。这是一个精确的一行修复,完全解决了量化 EAGLE3 模型的加载失败问题,风险极低,且有实际模型验证(MiniMax-M3)。建议关注是否有其他类似的前缀路径不匹配问题存在于其他模块中。

2026-06-10
2026-06-06
2026-06-03
功能 重要性 6.71 洞察度 5.00

MRV2 支持 Llama 与 Mistral 密集模型

建议在合并后密切监控 Llama/Mistral 相关测试的稳定性,并优先处理 force_v1_runner 的环境变量覆盖问题。该 PR 值得精读,展示了 MRV2 激活的标准流程测试适配模式。

2026-05-20
功能 重要性 6.90 洞察度 4.00

为 NemotronH 添加非 MTP 推测解码支持

建议精读 `nemotron_h.py` 中 `forward` 方法的改动,理解 `_maybe_add_hidden_state` 的收集机制。同时关注 `EagleModelMixin` 的定义,以评估后续推测解码设计的可扩展性。

功能 重要性 7.25 洞察度 6.00

支持 EAGLE-3 后归一化与动态辅助隐藏状态

该 PR 值得精读,尤其是在 vLLM 中如何灵活扩展推测解码模型架构的范例。关键设计决策包括:动态辅助状态数量、两种归一化方案(全局 vs 逐块)以及输出归一化选择,为后续模型支持提供了模式。建议关注配置兼容性和潜在覆盖风险的后续处理。