近日,英伟达开发者论坛的一位用户ciprianveg分享了一个本地AI算力测试的成果,他将16台英伟达DGX Spark组合成一个计算集群,成功运行了完整的Kimi-K3大模型。测试显示,在16000的上下文深度下,该系统的生成速度最高可达38 t/s。英伟达DGX Spark是一款专为本地AI开发和推理设计的桌面设备,但随着更大型模型如Qwen和DeepSeek的普及,单台设备的计算能力和显存常常无法满足其需求。通过增加计算节点,该项目成功地将应用场景从单机扩展到了多机并行处理。
为适应16台设备协同工作所需的巨大数据吞吐量,项目在网络配置上进行了特别设计,使用一台MikroTik CRS804-4DDQ核心交换机进行网络调度,并辅以4根400G转4×100G的高速分支线缆,将所有GB10节点串联起来。系统基于Inferact/Kimi-K3-DSpark环境,以分布式方式首次启动该模型。
具体基准测试结果显示,在4000的深度下,模型的预填充(即处理输入提示词的准备阶段)吞吐量为654.89 t/s,首次响应时间约为8.3秒,生成速度为21.71 t/s;当上下文深度增加至16000时,预填充吞吐量升至758.78 t/s,首次响应时间延长至约21.5秒,但生成速度提升至25.39 t/s,峰值达到38.00 t/s。该用户表示,这只是初步测试的结果,未来将进行更深入的性能优化,并计划很快将运行镜像和使用指南上传至GitHub。 球友会