BeamModel

Beam 部署教程

权重尚未公开。以下命令按各推理引擎的常规用法编写,会在权重发布当天实测并更新。请将占位的仓库 ID 替换为官方仓库 ID。

准备工作

FP8 精度下仅权重就需约 500 GB,需要 8× H200 或 8× B200 这类多卡节点。如果打算在 Apple Silicon 或 CPU 上运行量化后的 GGUF 版本,请先用 显存计算器 估算所需内存。

1. 下载权重

pip install -U "huggingface_hub[cli]"
# 国内网络可使用镜像
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download <beam-repo-id> --local-dir ./beam

2. vLLM(推荐用于服务部署)

pip install -U vllm
vllm serve ./beam \
  --tensor-parallel-size 8 \
  --max-model-len 131072 \
  --port 8000

3. SGLang

pip install -U "sglang[all]"
python -m sglang.launch_server \
  --model-path ./beam \
  --tp 8 \
  --port 8000

4. llama.cpp(GGUF,消费级硬件)

社区 GGUF 量化版本通常会在发布后几天内出现。大模型会被拆成多个分片文件,-m 参数指向第一个分片即可。

llama-server \
  -m ./beam-gguf/<first-shard>.gguf \
  -c 32768 \
  -ngl 99 \
  --port 8000

5. 测试 OpenAI 兼容接口

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "./beam", "messages": [{"role": "user", "content": "Hello"}]}'