async_sglang_server.py — SGLang 异步服务器¶
文件概述¶
SGLang 推理 HTTP 服务器和副本管理的实现,结构与 vLLM 的 vllm_async_server.py 对应。
核心类¶
SGLangHttpServer¶
class SGLangHttpServer:
"""SGLang HTTP 推理服务器
功能与 vLLMHttpServer 对应:
- 启动 SGLang 推理引擎
- 提供 HTTP API
- 管理显存(sleep/wake_up)
- 处理权重更新
"""
async def launch_server(self):
"""启动 SGLang 推理服务"""
pass
async def generate(self, prompt_ids, sampling_params, request_id):
"""生成序列"""
pass
SGLangReplica(RolloutReplica)¶
class SGLangReplica(RolloutReplica):
"""管理 SGLang 服务器副本的部署"""
async def launch_servers(self):
"""在每个节点启动 SGLang 服务器"""
pass
与其他模块的关系¶
- 继承
rollout/replica.py的RolloutReplica - 使用 SGLang 框架的推理引擎
- 被异步推理管理器调度
小结¶
SGLang 的服务器端实现,与 vLLM 版本功能对等,通过 Ray actor 部署在计算节点上。