Premium ReportIndustry Insights
打破内存墙瓶颈:华为携手学术界推出FLINT架构,重塑大模型推理基石
9/1/2026
3 VIEWS
近日,华为联合苏黎世联邦理工学院(ETH Zürich)与华中科技大学(HUST)发布了名为“FLINT”的创新架构研究。在当前大模型(LLM)落地过程中,算力瓶颈已从单纯的计算单元吞吐量转向了片上内存(HBM)的容量限制。这一痛点在边缘侧及中小规模推理节点中尤为显著。FLINT架构通过构建“高带宽闪存(HBF)”底座,实现了一种工作负载驱动的内存分层方案,其核心在于平衡延迟与容量,使超大规模参数模型能够以更低的成本在资源受限的硬件上运行。
从行业影响分析来看,FLINT的问世标志着存储层级优化正成为AI硬件架构的核心竞争力。长期以来,HBM虽然具备极致带宽,但其成本高昂且扩展性受限。FLINT通过智能的数据调度与预取算法,将高性能闪存引入内存层级,不仅提升了系统整体的性价比,还显著放宽了推理任务对昂贵GPU显存的依赖。这一研究成果对于华为等布局全栈AI芯片的厂商而言,意味着可以利用现有的存储技术储备,通过架构革新在不牺牲用户体验的前提下,大幅提升存算比。
在供应链层面,该技术有望引发存储产业链的连锁反应。如果架构设计能够广泛采纳,高带宽、低延迟的非易失性存储器(如新型NAND或NVMe类闪存)在大模型应用中的占比将大幅提升,进而刺激存储模组厂商向更贴合AI负载的定制化存储方向转型。同时,这也为半导体封测领域提出了新的集成挑战,如何将大规模闪存更紧密地与计算核心耦合将成为下一代推理芯片设计的关键。
未来展望方面,FLINT架构展现了存内计算(IMC)之外的另一条演进路线:即通过软件定义与存储分层来释放算力潜力。随着模型参数向万亿级别迈进,单纯增加计算密度已显疲态,FLINT所倡导的“容量可扩展”理念将成为下一代通用推理机架构的主流。预计在未来两到三年内,基于类似FLINT逻辑的异构存储解决方案将从实验室走向数据中心商用,助力AI推理向轻量化、普及化方向迈进,进一步缩小技术落地的成本鸿沟。
