DGX Spark 模型基准测试

10 个主 LLM · 2 个 RAG 辅助模型 · 完整资产审计 + 性能/能力/稳定性实测 + 参数调优,为 GB10 121GiB 统一内存单机确定最佳单人服务配置。
主机 spark-484e · NVIDIA GB10 · aarch64 · sm_121
测试窗口 2026-07-30 00:30–20:xx CST
运行时 vLLM 0.22.1 · nvcr.io/nvidia/vllm:26.06-py3
冠军模型
Qwen3.6-35B
decode 75.75 tok/s,比当前默认快 21×
全场最低 TTFT
0.052s
Qwen3.6-35B-A3B
测试规模
10模型
+2 RAG · 24 组配置运行 · ~20h 机时
稳定性
0崩溃/OOM
1 处可修复配置边界 bug(已记录)
当前默认接口
qwen3-32b
:8000/v1 已恢复并验证

最终推荐

按使用场景挑选,非唯一答案

性能对比

单请求 decode 速度 · 越长越快
decode tokens/s(单并发)

首 Token 延迟 (TTFT)

越短越快 · 短 prompt 场景

冷启动耗时

权重从磁盘完整读取,含引擎初始化

能力矩阵

代码任务为真实执行单测判定,非语法检查 · 3处"开启思考"数据于首版发布后补全并更正
模型(最佳配置) 代码生成 代码修复 JSON 严格输出 长文档抽取 工具调用 推理(关闭思考) 推理(开启思考)

核心发现

按重要性排序,建议按顺序读

已知限制

诚实披露,未静默隐藏