为render服务器添加/derender端点完成解聚后处理
推荐精读`vllm/entrypoints/serve/render/serving.py`和`vllm/entrypoints/openai/engine/serving.py`,理解设计决策:如何在保持generate server无tokenizer的情况下实现端到端文本响应。特别是`format_token_id_placeholder`/`resolve_token_id_placeholder`的对称设计值得参考。审查中关于代码合并与解耦的讨论也具有学习价值。
参与讨论