Beam 部署教程
权重尚未公开。以下命令按各推理引擎的常规用法编写,会在权重发布当天实测并更新。请将占位的仓库 ID 替换为官方仓库 ID。
准备工作
FP8 精度下仅权重就需约 500 GB,需要 8× H200 或 8× B200 这类多卡节点。如果打算在 Apple Silicon 或 CPU 上运行量化后的 GGUF 版本,请先用 显存计算器 估算所需内存。
1. 下载权重
pip install -U "huggingface_hub[cli]"
# 国内网络可使用镜像
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download <beam-repo-id> --local-dir ./beam2. vLLM(推荐用于服务部署)
pip install -U vllm
vllm serve ./beam \
--tensor-parallel-size 8 \
--max-model-len 131072 \
--port 80003. SGLang
pip install -U "sglang[all]"
python -m sglang.launch_server \
--model-path ./beam \
--tp 8 \
--port 80004. llama.cpp(GGUF,消费级硬件)
社区 GGUF 量化版本通常会在发布后几天内出现。大模型会被拆成多个分片文件,-m 参数指向第一个分片即可。
llama-server \
-m ./beam-gguf/<first-shard>.gguf \
-c 32768 \
-ngl 99 \
--port 80005. 测试 OpenAI 兼容接口
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "./beam", "messages": [{"role": "user", "content": "Hello"}]}'