DGX Spark 模型基准测试
10 个主 LLM · 2 个 RAG 辅助模型 · 完整资产审计 + 性能/能力/稳定性实测 + 参数调优,为 GB10 121GiB 统一内存单机确定最佳单人服务配置。
主机
spark-484e
· NVIDIA GB10 · aarch64 · sm_121
测试窗口
2026-07-30 00:30–20:xx CST
运行时
vLLM 0.22.1
· nvcr.io/nvidia/vllm:26.06-py3
冠军模型
Qwen3.6-35B
decode 75.75 tok/s,比当前默认快 21×
全场最低 TTFT
0.052
s
Qwen3.6-35B-A3B
测试规模
10
模型
+2 RAG · 24 组配置运行 · ~20h 机时
稳定性
0
崩溃/OOM
1 处可修复配置边界 bug(已记录)
当前默认接口
qwen3-32b
:8000/v1 已恢复并验证
最终推荐
按使用场景挑选,非唯一答案
性能对比
单请求 decode 速度 · 越长越快
decode tokens/s(单并发)
首 Token 延迟 (TTFT)
越短越快 · 短 prompt 场景
冷启动耗时
权重从磁盘完整读取,含引擎初始化
能力矩阵
代码任务为真实执行单测判定,非语法检查 ·
3处"开启思考"数据于首版发布后补全并更正
模型(最佳配置)
代码生成
代码修复
JSON 严格输出
长文档抽取
工具调用
推理(关闭思考)
推理(开启思考)
核心发现
按重要性排序,建议按顺序读
已知限制
诚实披露,未静默隐藏