
9月5日消息,英伟达开发者论坛用户ciprianveg近日公布了一项本地AI算力测试,通过将16台英伟达DGX Spark组成运算集群,成功运行了完整的Kimi-K3大模型,测试结果表明,该系统在16000深度下的最高生成速度可达38 t/s。英伟达DGX Spark原本是面向本地AI开发和推理的桌面设备,随着Qwen、DeepSeek等模型的普及,单台设备的计算和显存资源往往难以满足千亿参数模型的需求。当上下文深度增加至16000时,预填充吞吐量提升至758.78 t/s,首次响应等待时间延长至约21.5秒,但生成速度反而提升至25.39 t/s,峰值达到38.00 t/s。该发帖人还表示,这仅是未经过充分调优的首次测试成绩,后续他计划继续优化整体性能,并将在近期把运行镜像和使用说明上传至代码托管平台GitHub。