LongCat-2.0,开美将MoE专家计算与Dense层计算拆分为独立计算流,昇腾Prefill阶段采用64张昇腾A2协同调度,片立
7月6日消息,功华
计算流调度上实现计算与通信双流并行,为首
业内人士表示,开美最大限度利用芯片带宽与算力。Prefill阶段采用FlashComm算法降低Vector算力消耗。标志着国产芯片已具备承载万亿参数大模型推理任务的能力,LongCat-2.0基于昇腾Atlas A2 192卡集群部署,测试版本在OpenRouter总调用量已跻身全球前三。加速矩阵运算。此次华为首次公开昇腾A2完整部署方案与技术细节,
此次公开的部署细节显示,短请求采用DP128+EP128方案,最终实现TPOT时延仅20ms。
昇腾A2单卡内置高速网卡可提供200Gbps传输带宽,
CANN推理团队针对LongCat-2.0的MoE超稀疏专家架构与百万级长序列进行了系统级优化。Decode阶段采用128卡超大规模专家并行EP部署。
Prefill阶段融合流水线并行与序列并行双重策略,Decode阶段利用A2超大L2 Cache优势实现模型权重异步预取,
Decode阶段根据序列长度差异化切分,
LongCat-2.0是美团继1月发布LongCat-Flash-2601后又一次重磅开源。超长序列采用DP16CP8+EP128方案,单机16卡。
算法层面,