TokenLab

大模型推理算力与 GPU 部署规划速算专家

80% 安全水位 · 1/2/4/8 拓扑对齐 · OpenClaw 就绪

运行精度

{{ fp8Hint }}

⚙️ 高级业务场景设置 展开

B={{ form.batch }} · I={{ form.inputTokens }} · O={{ form.outputTokens }} · 带宽{{ Math.round(form.bandwidthEff * 100) }}%

腾讯云轻量服务器首购特惠

{{ familyLabel }} 全尺寸

{{ gpu.name }} · {{ effectivePrecision }} · B={{ form.batch }}

Live

{{ row.sizeLabel }} 蒸馏

{{ row.methodNote }}

({{ row.paramsB }}B | L={{ row.L }} | {{ row.precisionLabel }}权重约{{ fmtMemShort(row.M_model) }})

({{ row.paramsB }}B | L={{ row.L }} | {{ effectivePrecision }}权重{{ fmtMemShort(row.M_model) }})

{{ row.compareText }}

精度:{{ row.accuracyLoss }}

卡数

{{ row.recommendedGpus }}卡

水位%

{{ row.actualWaterlinePct.toFixed(0) }}%

首T

{{ fmtLatency(row.timePrefillMs) }}

单卡/s

{{ fmtTps(row.singleTokPerSec) }}/s

右侧卡数/水位/首T/单卡:自算行按当前精度;「官方量化」行按厂商卡数重算首T与吞吐。厂商含余量,可不一致。

量化精度损失(相对 BF16/FP16 · 经验区间 · 任务相关)

  • · {{ note }}
腾讯云 AI 焕新特惠

Authority · Whitepaper

参数来源与计算白皮书

硬件物理参数 · 核心公式 · 工业级部署标准 — 常驻可查

🔌 硬件物理参数(锁定表)

GPU 显存 带宽 FP16 FP8
{{ g.name }} {{ g.memoryGB }} GB {{ g.bandwidthTB }} TB/s {{ g.tflopsFP16 }} {{ g.tflopsFP8 != null ? g.tflopsFP8 : "—" }}

📐 核心计算公式(GiB / Dense)

HKV = H × (kvHeads / totalHeads)

Mmodel = paramsB × 1e9 × 2 / 1024³

Mkv = 2 × L × HKV × (I+O) × B × 2 / 1024³

Mbusiness = Mmodel + Mkv

theoreticalGpus = ⌈ Mbusiness / (mem × 0.8) ⌉

recommendedGpus = align↑(1, 2, 4, 8, 8k)

Decode step = (Mbusiness × 1024³) / (bandwidthTB × N × eff × 1e12)

集群 tok/s = B / Decode_step

🏭 工业级部署标准

  • 业内 80% 安全水位,拒绝「刚好装下」。
  • 理论卡数向上对齐到 1 / 2 / 4 / 8 / 8k
  • 仅计 Dense FP16 TFLOPS,不含稀疏宣传峰值。
🤖 智能体/机器人一键安装包 (OpenClaw / WorkBuddy / Hermes Agent) 点击展开

Developer · OpenAPI

标准 OpenAPI JSON Schema / OpenClaw Config

API → http://124.220.3.218/api/v1/calculate

{{ copyToast }}

社区一键安装说明书

  1. 复制上方 JSON Config / OpenAPI Schema。
  2. 发给企微 / OpenClaw / WorkBuddy / Hermes Agent。
  3. 安装后可用自然语言问「买几张卡 / tok/s」。