算力之后,存储成为AI利用落地的“输赢手”
从前两年,讨论AI的人险些把所有把稳力都给了GPU。英伟达的市值、H100的供货周期、台积电的先进造程,算力是舞台中央的主角。但在舞台侧幕,存储行业的刷新在发生:GPU越来越快、越来越贵,而给GPU“喂饭”的存储系统跟不上了。 五年前,存储还只是配角,掌管存放训练数据、保留查抄点,在GPU必要时提供数据。但今天,当大模型参数量突破万亿级别、推理Token亏损量一年增长近20倍时,存储系统正被迫从幕后走向台前,成为造约AI落地的主题瓶颈。 OpenRouter与a16z结合颁布的《State of AI》汇报显示,OpenRouter平台的年Token处置量在一年内从约10万亿飙升至超过100万亿,单日峰值已突破1万亿。训练在涨,推理在涨,涨得比所有人的预算都快。 与此同时,中国信通院颁布的数据显示,全球AI推理算力市场规模从2021年的14.04亿美元跃升至2024年的139.58亿美元,年均复合增长率达到66.3%。更关键的是,推理工作负载占比从2023年的41.3%持续攀升,预计2026年将达到70.5%,实现对训练算力的全面超过。这意味着,AI算力市场正经历从"训练驱动"到"推理驱动"的底子性转变。 推理市场和需要的发作式增长带来了一个问题:作为数据搬运工的内存和SSD并没有以同样的速度变快。因而如今业内经?吹阶罟蟮男酒笔贝τ凇按仁荨钡淖刺,而存储设备,成了决定整个AI系统性价比的关键变量。这不是某一家厂商的;,而是整个存储行业的一次集体考题。 TrendForce集国征询的数据同样印证了这一趋向:2025年全球企业级SSD市场规模达280亿美元,2026年第一季度全球前五大企业级SSD营收达201亿美元,环比增长85.8%。三星电子维持第一名,2025年第四时营收近36.6亿美元,季增49.7%;SK集团(含SK海力士和Solidigm)位居第二,营收32.6亿美元,季增超过75%;美光位居第三,营收超过14亿美元,季增41.4%。 训练时期,SSD像个仓库重要的工作是装下海量的文本、图片、视频,等GPU开工时按批送货,此表还必要写查抄点。大模型训练功夫通常必要数月,几千张卡里随时可能有卡掉队,所以要定期把模型参数和优化器状态落盘,出事时好从最近的查抄点爬起来。这两件事对存储的要求很朴素:带宽要够大,容量要够多,别掉链子。 变动的本原在于Transformer架构的运行机造。模型每天生一个新Token,都必要推算其与前文所有词元之间的关联关系,这些中央了局被缓存为KV Cache。高低文越长,KV Cache越大,且随高低文长度线性增长。当前主流模型普遍支持百万级高低文,单条会话的 KV Cache即可占用数GB至数十GB空间。而HBM是全数据中心单元成本最高的存储空间,以其承载长高低文,在成本上并不具备可持续性。 这就造成了KV Cache向表溢出。首先是主机DRAM,进而下沉至SSD。存储的角色由此从数据容器,转变为GPU的扩大内存。这一位移带来的直接后果是:存储层的任何延长抖动,城市被转化为 GPU的空转功夫。 需要结构的变动,已经在市场规模上得到验证。据Counterpoint Research 的季度追踪,2026年第二季度企业级SSD已占全球 NAND 闪存出货容量的48%,而一年前这一比例仅为26%,该机构预计到2026年底将超过一半。 首先是数据“喂”不鼓GPU。传统的存储系统是为CPU设计的。当GPU必要数据时,数据必须先经过CPU、再经过主机内存,能力最终达到GPU,这个过程中,每一步都在亏损功夫和资源。三星的实测数据显示,在4KB幼I/O前提下,系统现实只用了接口带宽的约27%,其余73%被软件开销“吃掉了”。何兴直言:“传统的PCIe、NVMe发展了好多年,有软件职守,要两全老设备和复杂情况。但在AI场景下,这些汗青包袱有可能被简化。” 其次是KVCache的“写放大”困局。大模型推理中,KVCache是维持长对话高低文的关键。但当KVCache被卸载到SSD时,分歧要求的KV数据交错存储,一旦某条数据过期,SSD必须将统一块中其他有效数据重新写入,但这大幅缩短了SSD的使用寿命,也拉低了系统吞吐。 第三是万亿参数模型装不进显存。当前主流大模型已普遍转向 MoE(混合专家)架构,其主题优势在于稀少激活:每个Token仅需唤醒少量专家,模型规模得以大幅扩张,而算力开销不会同比例上升。但其价值是,全数专家权重仍需常驻显存。算力开销因而得到节造,显存占用并未同步降落。万亿参数模型的权重规模远超单机 HBM容量,只能下沉至到系统内存和SSD,而决定模型现实吞吐的,正是SSD的随机读取机能。 这三个新的需要将存储系统推到了台前,从前几十年,存储的设计思路是围着CPU转。但如今行业必须回覆一个问题:存储,该怎么变? 针对前文提到的三个新需要,三星半导体Memory战术规划总监冯方将产业的应对蹊径综合为两个方向:一是提升硬件自身的机能与容量,二是压缩软件栈的冗余开销。三星近两年的产品与技术布局,提供了一个相对齐全的观察样本。 先说硬件,竞争的主角首先是HBM。这个市场的座次这两年发生了戏剧性变动。SK海力士凭借多年深耕,成为英伟达HBM的主题供给商;但三星电子在急剧追赶,在HBM4E的送样节拍上争先一步——2026年5月29日,三星率先向全球重要客户交付业界首批12层HBM4E样品;约三周后,SK海力士于6月18日跟进,向重要客户交付12层HBM4E工程样品。 在技术规格上,HBM4E相较前代实现了显著逾越。三星12层HBM4E单仓库容量达48GB,可提供不变的14Gbps引脚传输速度,机能可扩大至16Gbps,单仓库带宽高达3.6TB/s;能效较HBM4提升16%以上,热阻改善超14%。SK海力士的12层HBM4E同样实现48GB容量,单引脚最高数据处置速度达16Gbps,能效提升20%以上,热阻改善17%。双方均选取12层堆叠达成48GB容量,用更少的堆叠层数实现了更高的容量密度,直接回应了AI训练与推理对内存带宽和容量的持续攀升的需要。 三星作为HBM市场先行者,其优势被三星半导体Memory战术规划总监概括为概括为“端到端整合”。全球领域内能同时自研NAND颗粒、DRAM、主控芯片并占有壮大固件能力的厂商寥若晨星。这意味着当头部云厂商提出定造需要时,三星能够在内部关环实现底层逻辑批改,而无需像主控表购的厂商那样与第三方来回拉锯数月。 在内存层面,三星率先押注CXL。自2019年CXL同盟成立以来,三星一向担任董事会成员,在这次ODX大会上,三星展示了最新的CMM-D 320内存?,该产品基于CXL 3.2和谈,提供128GB和256GB两档容量。延长上,其器件级接见延长约110纳秒(三星测试数据)——这一水平已极度靠近本地DDR内存80纳秒的物理延长。共同64字节Cache Line粒度的原生load/store接见与缓存一致性,CPU可将其作为可寻址内存直接使用,无需经过网络和谈栈与新闻语义转换——这正是它与基于 RDMA的远端内存池规划在接见语义上的根本分野,也是它可能承接推理侧KV Cache卸载与内存池化的原因。 面向端侧AI的发作式需要,三星在ODX 2026上初次在国内公开解说了zNAND-O技术。该产品基于SLC晶片与TSV硅通孔技术,以与DRAM相当的带宽实现了十倍于DRAM的位元密度、七倍于NAND的读取带宽,并将NPU与存储集成在单一封装内,通过UCIe接口互连。zNAND-O使内存成本降落四倍、机能不降,且能承载靠近两倍规模的模型(三星仿真数据,现实了局随系统配置与负载而异)。端侧推理与云端推理,在形成两条相辅相成的路线。 在SSD侧,三星给出了机能与容量两条并行的产品线。面向机能市场的是PM1763——三星的PCIe Gen6企业级SSD,选取第九代V-NAND(V9)TLC颗粒、自研4nm主控与PCIe Gen6接口,并针对液冷服务器环境做了专门设计。值妥贴心的是颗粒、主控、固件同出一家这件事自身。Gen6把接口带宽又翻了一倍之后,瓶颈往往不在NAND颗粒,而在主控与固件能否把这些带宽真正调度出去——自研主控意味着这部门优化能够在内部关环实现,这正是前文"端到端整合"最直接的体现。 与之互补的容量型产品BM1773则扛起高密度存储的旗号,同样基于第九代V-NAND但选取QLC颗粒,覆盖16TB至256TB容量区间,面向AI数据湖、查抄点归档和KV Cache冷热分层下沉等大容量场景,在"机能"与"预算"之间为云厂商提供了第二个可选的坐标点。 在固件层面,三星重点解决AI推理中KV Cache卸载引发的写入放大问题。其PCIe Gen5企业级SSD率先导入FDP(矫捷数据搁置)技术——由主机奉告SSD“这批数据属于统一类业务、性命周期一样”,SSD便将其物理隔离存放,从而显著削减无效数据搬移。三星基于LMCache框架和8张RTX 6000 GPU的内部测试显示,启用FDP后峰值WAF降低49%,累计NAND写入量削减36%。更进一步,三星还推出了“无感FDP”的JBOF参考固件,主机端无需批改任何软件代码,固件在盘阵侧自动实现数据热度分析和LBA映射。在延长的分位测试中,当靠得住性要求推到7个9(99.99999%)时,这套规划的延长约为原生内核规划的四分之一,为MoE专家卸载等场景提供了坚实的存储底座。 从CXL的内存池化,到zNAND-O的端侧内存层级的重构,再到FDP的SSD智能优化,三星正以多维杜撞件创新回应AI对内存带宽、容量、延长和成本的全方位挑战。 再看软件侧。今年8月初的北美FMS大会上,英伟达颁布了“三件套”:颁发开源GPUDirect Storage(GDS)的cuFile API、推出SCADA架构,并颁布了Storage Next的产业愿景。若是说此前的GDS重要解决了大文件的挨次读写,那么以SCADA为代表的新一代GiDS规划,则将“节造权”也彻底从CPU剥离,专门攻克AI缓存中海量幼文件的随机读写瓶颈。与此同时,AMD也在推动类似定位的ROCm-XIO,打算让GPU/XPU直接提议I/O。NVIDIA博客的官方表述是:要让GPU以微秒级速度直接读写存储。 系统软件厂商同样闻风远扬:Pure Storage的FlashBlade系列产品是最早获得NVIDIA GPUDirect Storage认证的全闪存储之一,并已进入NVIDIA DGX SuperPOD认证存储名单;VAST Data以其“解耦共享所佑妆(DASE)架构切入AI存储市场,让所有存储节造器共享全数介质与元数据,近期还与Cloudera达成战术合作共建“AI工厂”;Weka、Hammerspace等并行文件系统厂商则通过GPUDirect支持切入英伟达生态。 主控厂商也没闲着,Marvell在2025年11月的一篇博客中明确提出,AI在催生“GPU提议的存储”与“CPU提议的存储”的分化:将来针对GPU直连优化的SSD,将把IOPS和延长放在首位,与面向CPU、以容量和吞吐为先的传统SSD形成两条产品线。 而三星给出的答案则是AiSIO(Accelerator-integrated Storage I/O)——一个让GPU可能直接“开车”去SSD取数据的开源软件框架,对此,冯方通知我们,在NVIDIA H100加三星PCIe Gen5 NVMe SSD的测试平台上,AiSIO实现了三种I/O模式的全支持,“16块盘整机可达6150万IOPS,CPU占用仅需1.5个主题(3个线程)。指标1亿IOPS,预计只需2个CPU主题(约24块盘),甚至在GiDS模式中能够不占用CPU资源”冯方介绍路。 更重要的是,AiSIO齐全兼容现有文件系统,无需刷新已有软件栈,且全数开源,已部门合入或打算合入Linux内核主线。“我们2026年在原来和特定厂商合作的基础上,全数更新了公开的、各人都能够用的开源实现。”冯方进一步指出,“这一决策的意思在于,任何加快器厂商都能够接入。” 硬件与软件两条线,在汇成统一个结论:将来的存储竞争力,不再是堆参数,而是系统级的协同设计。无论是三星的端到端整合、SK海力士的HBM先杏注Solidigm的密度路线,还是英伟达与AMD主导的直连存储生态,所有人都在回覆统一路题:若何让数据以最低的价值、最快的速度,到达最必要它的推算单元。 若是我们再把功夫线拉长,存储行业接下来“卷”的方向已经跃然纸上,冯方与何兴也都给出了统一的答案:存储将不再只是数据的仓库,而是长出推算能力的车间。这个趋向,业界称之为“近数据推算”,与其把数据千里迢迢搬到推算单元,不如让推算能力下沉到数据旁边。 这个判断并非空穴来风,而是产业演进的必然。何兴与我们分享了存储金字塔:G1是GPU的HBM,G2是CPU内存,G3是本地SSD,G3.5是散布式存储池,G4是传统存储阵列。AI负载对每一层的要求分歧,热数据要低延长,冷数据要大容量、低成本。而治理这个分层、决定数据该待在哪一层,自身就是推算工作。 基于此,何兴通知我们,三星Seamless FDP固件做的事是运行时辰析数据热度、动态更新LBA映射、自动分配回收单元,“性质上就是让推算发生在数据旁边,这就是近数据推算最朴素也最有效的状态。”何兴强调。 事实上,这条路上早有先行者:ScaleFlux等公司几年前就把硬件压缩/解压引擎直接做进了SSD主控,让数据在写入盘片的瞬间实现压缩,CPU和主机总线全程无感;而Marvell眼中的“GPU-initiated存储”分化,性质上也是把I/O决策的推算权从主机交还给了离数据更近的设备。 沿着这个思路,以及当前存储厂商的业务方向能够预感将来企业级存储行业的发展趋向。首先就是盘内推算与索引能力会持续加强。RAG场景下,推理系统必要从海量向量中做类似度检索,若是SSD或存储阵列能内置向量索引,将索引的操作在存储上实现,网络和主机的职守城市大幅降落。三星JBOF固件钟装运行时负载分析与LBA映射”的设计,已经是这类能力的雏形。 其次,KV Cache的治理权在向存储侧迁徙。数据冷热分层、预取、过期回收,这些从前由推理框架承担的调度逻辑,在部门下沉到存储固件中,形成“存储即缓存层级”的新角色。 第三,内存与存储的天堑会进一步吞吐。CXL让SSD有了挂上内存总线的可能,而三星最新推出的zNAND-O则索性把NAND与NPU封装在一路,内存和存储之间那条一连数十年的分界限,在被AI的需要一点点抹平。 除了存储离推算场景“更近」剽点扭转之表,对于存储厂商而言,业务模式也在发生着变动。冯方通知我们,原先存储厂商更多是提供一个尺度化的硬件产品,而在AI时期,必要存储厂商更多的深刻到客户业务场景中,提供软硬协同的定造化服务。冯方泄漏,三星已在全球设立Memory Research Center(SMRC)等研发支持职能,把软件和固件工程师直接派到头部云厂商的架构师身边,现场关环解决问题,“我们不再是单一地卖一块盘,而是提供一套无缝的解决规划。”冯方这样形容当前三星存储业务。 存储行业从前数十年的主题职责,是安全且齐全地保留数据。而此刻,其被要求在正确的时刻、以可接受的成本,将数据投递正确的地位。存储设备最终将获得几多算力、能在多大水平上自主实现数据有关的处置,业界尚无定论。但方向已经明确:既然数据移动的价值已难以接受,让推算向数据挨近便成为必然选择。
中国女篮不敌法国无缘世界杯四强
重磅!市教委最新通知,暗藏教改大作为
硬核智能科技赋能警务法律,《全球时报》记者探访第三届公共安全科技设备展
张不开嘴别尬演!《生逢其时》刘琳吃饺子,打脸流量明星塑料演技
对日本,铺排!
阿莱格里:若是我们踢国米能展示这种心灵,就不成能连丢三球
科莫主席:幼法总有一天会脱离这里,他必须助我们找到继任者
苹果进入特努斯时期,首发 15999 元折叠屏 iPhone;Deepseek 被曝备战科创板 IPO;谷歌埃森哲组建千人 FDE 团队 | 极客早知路
墨尔本成功官方:38岁老将马塔不再作为球员出场,将专一于股东工作
博斯:荷兰足协错失了埃因霍温的左后卫毛罗-儒尼奥尔
所以Luke更喜欢沙发,对吗?
队报:内马尔参加桑托斯引援,促成阿图尔、埃弗顿和库鸟加盟
彩经前瞻:阿斯顿维拉vs诺丁汉丛林;首选主胜,次防平局
苹果进入特努斯时期,首发 15999 元折叠屏 iPhone;Deepseek 被曝备战科创板 IPO;谷歌埃森哲组建千人 FDE 团队 | 极客早知路
高通第六代骁龙8至尊版系列集玉成新Hexagon NPU:专为AI智能体打造
助攻破僵局,多古当选曼联vs沙巴巴库全场最佳
佐野海舟谈德比:想让数据措辞,对阵法兰克福确信能赢
高盛大幅上调光?槌龌踉て,全球光通讯产业会迎来价值重估吗?
OpenAI颁布ChatGPT Images 2.5:天生速度最高提升50%,AI建图“指哪改哪”
伊朗或“逆向开发”美军潜航器:技术战还是宣传战?
“疆算入渝”算力交付暨中国移动—阿里云智算中心项目在新疆哈密开工
亚马尔20岁前欧冠已打入12球,距姆巴佩纪录仅差1球
意大利汽车行业协会呼吁欧盟:对超额中国车及零部件征收80%关税
马特拉齐:弗洛伦蒂诺信赖造就回归,穆帅能联结皇马更衣室