跳转至

async_sglang_server.py — SGLang 异步服务器

文件概述

SGLang 推理 HTTP 服务器和副本管理的实现,结构与 vLLM 的 vllm_async_server.py 对应。

核心类

SGLangHttpServer

class SGLangHttpServer:
    """SGLang HTTP 推理服务器

    功能与 vLLMHttpServer 对应:
    - 启动 SGLang 推理引擎
    - 提供 HTTP API
    - 管理显存(sleep/wake_up)
    - 处理权重更新
    """

    async def launch_server(self):
        """启动 SGLang 推理服务"""
        pass

    async def generate(self, prompt_ids, sampling_params, request_id):
        """生成序列"""
        pass

SGLangReplica(RolloutReplica)

class SGLangReplica(RolloutReplica):
    """管理 SGLang 服务器副本的部署"""

    async def launch_servers(self):
        """在每个节点启动 SGLang 服务器"""
        pass

与其他模块的关系

  • 继承 rollout/replica.py 的 RolloutReplica
  • 使用 SGLang 框架的推理引擎
  • 被异步推理管理器调度

小结

SGLang 的服务器端实现,与 vLLM 版本功能对等,通过 Ray actor 部署在计算节点上。