OmniTools 7月2日消息,Meta 公布其面向 AI 训练的大规模存储架构方案,目前运营数百 EB 级存储集群,基于 Tectonic 分层存储层构建新型 BLOB 存储架构。
该架构旨在解决两大核心挑战:提升 GPU 利用率与加速研究迭代。传统 BLOB 架构中多层元数据查询可引发数百毫秒延迟,导致 GPU 因 I/O 等待而停顿;新方案将训练栈逐步迁移至 BLOB 存储接口,并利用闪存实现可预测的低 pMax 延迟,防止单卡慢速拖累整批任务。
统一数据湖支持地理分布 GPU 之间的高速数据注入与跨区域移动,进一步优化 AI 研究效率。相关技术细节已发布于 Meta 官方工程博客。