张量并行切分 我们来详细拆解一下张量并行(Tensor Parallelism, TP) 中的切分策略,这是一个非常核心且复杂的概念,理解它对于掌握大模型分布式训练至关重要,核心思想张量并行的核心思想是:将模型某一... wen 2026-07-02 31
环状全归约 分布式计算中的高效通信范式目录导读核心概念与定义:什么是环状全归约及其工作原理技术演进与对比:从传统归约到环形算法的变革性能优势分析:为何环状全归约能提升分布式训练效率应用场景与实践:在AI、HPC及... wen 2026-07-02 31
NCCL通信库 NCCL(NVIDIA Collective Communications Library,NVIDIA 集合通信库)是 NVIDIA 开发的一个专门用于多 GPU 和多节点之间高效通信的库,它专为深... wen 2026-07-02 33
AllReduce算法 这是一个关于AllReduce算法的全面解释,AllReduce是分布式计算和深度学习模型训练中最核心的通信模式之一,AllReduce的目的是:让集群中的每一个节点都拥有所有节点数据的“总和”(或其... wen 2026-07-02 32
RDMA在训练中 RDMA(Remote Direct Memory Access,远程直接内存访问)在深度学习训练中扮演着至关重要的角色,尤其是在大规模分布式训练场景下,它的核心作用是极大提升节点间的通信效率,从而缩... wen 2026-07-02 26
NVLink带宽 NVLink 的带宽取决于其代际(Generation)、物理配置(链路数量)以及具体的实现方式(如NVSwitch),截至2025年5月,主流的NVLink版本及其带宽如下:关键数据速览代际发布年份... wen 2026-07-02 37
检查点恢复时间 从理论到实践的全面指南目录导读什么是检查点恢复时间?检查点恢复时间的关键影响因素如何优化检查点恢复时间?常见问答(FAQ)总结与最佳实践什么是检查点恢复时间?检查点恢复时间(Checkpoint Re... wen 2026-07-02 31
InfiniBand与RoCE InfiniBand与RoCE深度对比:谁才是高性能网络与AI算力集群的未来?目录导读引言:高性能网络的时代背景InfiniBand深度解析:起源、架构与核心优势RoCE(RDMA over Conv... wen 2026-07-02 34
存储加速方案 “存储加速”是一个比较大的话题,涵盖了从硬件、软件到架构层面的多种技术,为了给你一个清晰且实用的方案,我会按照场景分类,从底层硬件到上层应用,给出目前业内主流的解决方案,核心原则存储加速的本质通常是解... wen 2026-07-02 30
断点续训机制 “断点续训”是深度学习和模型训练中非常实用的机制,它允许你暂停一段耗时很长的训练过程(比如因为断电、Out of Memory、或者只是下班了),并在之后从中断的地方重新开始,而不是从头再来,核心思想... wen 2026-07-02 35