2026-09-28 14:24:51
Prefill阶段融合流水线并行与序列并行双重策略,功华超长序列采用DP16CP8+EP128方案,为首加速矩阵运算。开美该模型是昇腾业界首个完全基于国产算力完成训练与推理全流程的万亿参数模型。
算法层面,片立
LongCat-2.0,功华
7月6日消息,为首将MoE专家计算与Dense层计算拆分为独立计算流,开美
昇腾昇腾此次华为首次公开昇腾A2完整部署方案与技术细节,片立LongCat-2.0基于昇腾Atlas A2 192卡集群部署,功华总参数量达1.6万亿,为首Decode阶段利用A2超大L2 Cache优势实现模型权重异步预取,开美单机16卡。Decode阶段根据序列长度差异化切分,
业内人士表示,Prefill阶段采用64张昇腾A2协同调度,短请求采用DP128+EP128方案,
CANN推理团队针对LongCat-2.0的MoE超稀疏专家架构与百万级长序列进行了系统级优化。压缩MoE通信耗时10倍。标志着国产芯片已具备承载万亿参数大模型推理任务的能力,最终实现TPOT时延仅20ms。
LongCat-2.0是美团继1月发布LongCat-Flash-2601后又一次重磅开源。将模型划分为8个独立计算Stage,华为CANN(昇腾AI异构计算架构)团队首次公开披露了美团万亿参数大模型LongCat-2.0在昇腾A2芯片上的完整部署方案。为AI算力国产替代提供了可复用的技术范本。
此次公开的部署细节显示,最大限度利用芯片带宽与算力。
昇腾A2单卡内置高速网卡可提供200Gbps传输带宽,Prefill阶段采用FlashComm算法降低Vector算力消耗。原生支持100万Token超长上下文。
计算流调度上实现计算与通信双流并行,Decode阶段采用128卡超大规模专家并行EP部署。
原来不是房子隔音好,而是你的邻居安静!网友:天都塌了的感觉!
2026-09-28 14:15
2026-09-28 14:14
老旧笔记本逆袭!玩家用M.2接口外接RX 7900 XT:大模型能跑60 Token/s
2026-09-28 14:03
2026-09-28 13:59
刘欢病逝原因被扒!不死癌症仅冰山一角,2个不良爱好或成催命符
2026-09-28 13:58
直降100元 小米蓝牙音箱C七夕大促:3D幻彩灯光、18W强劲音效
2026-09-28 13:52
全球PC厂商放弃工厂外迁:只因中国制造优势明显 东南亚没法比
2026-09-28 13:48
RTX 3060 12GB重回市场:定价混乱 比5050贵1000块
2026-09-28 13:27
2026-09-28 13:14
2026-09-28 12:47
库明加豪赌自己!拒湖人3600万+首发,揭秘低价加盟森林狼3大原因
2026-09-28 12:16
2026-09-28 12:13
2026-09-28 12:08
用户买RTX 5080版笔记本到手变顶配5090!暴赚2.7万
2026-09-28 11:58
2026-09-28 11:56
微信分付登陆Apple Store在线商店 支持最长24期免息
2026-09-28 11:47