Prhub

#39607 [Doc] Add Gemma 4 to supported models list

原始 PR 作者 z1ying 合并时间 2026-04-17 13:42 文件变更 1 提交数 6 评论 16 代码增减 +8 / -0

执行摘要

添加 Gemma 4 模型到支持模型列表文档。

根据PR body,Gemma4ForCausalLM和Gemma4ForConditionalGeneration已在代码中实现(如gemma4.py、gemma4_mm.py),但未在docs/models/supported_models.md文档中列出,因此需要更新以反映实际支持,避免用户混淆。

建议快速浏览以确保文档准确性,特别是模态支持注释部分,对使用Gemma 4多模态功能的用户有直接价值;无需深入代码分析。

讨论亮点

讨论焦点是Gemma 4的模态支持准确性:

  • 初始疑问:DarkLight1337指出可能有多视频/音频支持,引发对get_supported_mm_limits的检查。
  • 澄清细节:lucianommartins澄清所有模型支持文本+图像,音频仅限E2B/E4B变体,视频非原生输入但通过vLLM内部视频ingestor处理。
  • 决策结论:基于代码验证(如gemma4_mm.py中音频支持多输入),最终文档移除视频原生支持标记,添加变体特定音频注释,并保留视频从用户角度的支持说明。
  • 未解决疑虑:无,所有讨论点通过review确认后解决。

实现拆解

  1. 更新文本模型表格:在docs/models/supported_models.md的文本模型表格中添加Gemma4ForCausalLM行,包括模型名、示例ID、LoRA和PP支持,遵循现有Gemma 3条目格式。
  2. 更新多模态模型表格:在多模态模型表格中添加Gemma4ForConditionalGeneration行,指定模态为T + I⁺ + V + A*,并标注PP支持,添加通用标记*表示变体特定模态。
  3. 添加新注释和标记:在文档末尾添加note块,解释音频仅支持gemma-4-E2B和gemma-4-E4B变体,视频非原生输入但vLLM实现内部处理;同时新增<sup>*</sup>标记在脚注中,作为可复用通用说明。
  4. 验证和测试:通过pre-commit运行检查文档格式,未修改源代码或测试文件。
文件 模块 状态 重要度
docs/models/supported_models.md 模型文档 modified 2.31

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

Gemma 4 模态支持准确性的讨论 正确性

DarkLight1337 初始指出可能有多视频 / 音频支持,引发对 get_supported_mm_limits 的检查;lucianommartins 澄清视频非原生输入、音频仅限特定变体;ywang96 引用代码确认音频支持多输入;最终文档更新以反映正确信息。

结论:文档移除视频原生支持标记,添加变体特定音频注释,并保留视频从用户角度的支持说明,确保准确性。 · 已解决

风险与影响

作为纯文档更新,技术风险极低:

  • 回归风险:无,未修改任何源代码或配置。
  • 性能/安全风险:无直接影响。
  • 兼容性风险:低,文档变更不影响系统运行,但若不准确可能导致用户误解Gemma 4模态支持;已通过review讨论和代码引用(如gemma4_mm.py第207-212行)验证细节,降低了风险。

影响范围限于文档用户:

  • 用户影响:正面提高Gemma 4模型的可发现性和使用指导,特别是多模态用户能更准确了解音频和视频支持限制。
  • 系统影响:无,不改变代码逻辑、性能或部署。
  • 团队影响:文档维护更完整,减少后续混淆;新增通用标记*为未来模型文档提供可复用模式。
文档准确性风险

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论