本文目录导读:

这是一个非常深刻且具有前瞻性的问题,简短的回答是:在特定领域和特定架构下,对象存储已经成为了“主存储”,但在可预见的未来,它不会完全取代传统的块存储和文件存储成为所有场景的“唯一主存储”。
更准确的说法是:对象存储正在从“第二存储”(备份、归档)向“主存储”(生产级、高性能、核心应用)快速演进,并逐渐成为“新主存储”的标准。
下面我们来深入拆解这个问题。
为什么说对象存储“正在成为”主存储?
传统观念中,主存储必须满足三个核心要求:低延迟、强一致性、高性能(高IOPS/吞吐),过去,对象存储(如AWS S3, MinIO, Ceph)在这些方面是软肋,所以被用于备份、归档等温冷数据。
但近年来,情况发生了根本性变化:
-
性能的革命性提升:
- 全闪存NVMe:对象存储底层可以完全构建在NVMe SSD之上,延迟已从毫秒级降至微秒级。
- RDMA网络:使用InfiniBand或RoCE(RDMA over Converged Ethernet)网络,数据在节点间传输几乎不消耗CPU,大幅降低网络延迟。
- 软件栈优化:新一代对象存储(如MinIO, Ceph的新版本, NetApp StorageGRID)对协议栈、索引、元数据管理进行了深度优化,实现了“近乎本地文件系统”的性能。
-
架构的天然优势:
- 无限扩展性:对象存储的扁平化结构(Bucket+Object),使其可以扩展到EB级(Exabyte,百亿亿字节),而传统NAS(网络附加存储)在扩展到PB级(Petabyte,千万亿字节)后,元数据管理会成为瓶颈。
- 海量小文件:对象存储通过分布式元数据索引,在处理数十亿小文件时,性能远超传统文件系统(传统文件系统在目录下文件数过多时会急剧下降)。
- S3兼容性:S3协议已成为云原生世界的“通用语言”,所有现代应用(Kubernetes, 大数据, AI/ML, 微服务)都原生支持S3。
-
关键应用的迁移:
- AI/ML(人工智能/机器学习):AI训练的数据集通常是海量非结构化数据(图片、视频、文本),对象存储因其高吞吐、低成本和水平扩展能力,已成为AI训练数据湖的绝对主存储。
- 大数据分析:Spark、Presto等引擎已能高效地直接从S3读取数据,替代HDFS(Hadoop分布式文件系统)作为主要存储。
- 云原生应用:Kubernetes的持久卷(PVC)可以通过CSI(容器存储接口)直接挂载S3兼容的对象存储,许多微服务直接将对象存储作为其数据库或文件存储的后端。
- 视频监控与媒体处理:7x24小时的视频流、4K/8K素材,对象存储的高吞吐和持久性是理想之选。
- 数据库备份与日志:越来越多的数据库(如PostgreSQL的WAL归档、MySQL的备份)直接写入对象存储。
对象存储目前还无法成为“唯一主存储”的障碍
尽管进步显著,但对象存储在一些核心特性上仍无法替代传统的块存储(如SAN(存储区域网络))和文件存储(如NAS)。
-
延迟与事务性:
- 块存储(如全闪存SAN)延迟通常在几十到几百微秒,支持非常精细的原子写操作,是Oracle、SQL Server等关系型数据库的绝对首选,对象存储的延迟目前仍以毫秒计(即使是全闪存,也因网络开销和S3协议解析等),且S3协议本身不是为这种随机、小I/O的事务场景设计的。
- 文件存储(如高性能NAS)提供低延迟的文件级锁、强一致性,是VDI(虚拟桌面基础架构)、HPC(高性能计算)中某些共享数据的首选。
-
锁机制与一致性:
- 强一致性:大多数对象存储(如AWS S3)最终是“最终一致性”的写后读(尽管S3和MinIO等地表最强的宣称“强一致性”,但在某些边界场景下仍不如文件系统的锁机制严格)。
- 文件级锁:传统文件系统支持POSIX(可移植操作系统接口)的字节范围锁、文件锁等精细锁机制,支持多进程并发修改同一个文件,对象存储本身没有这种锁机制,必须通过应用层(如数据库)或附加组件(如hadoop的S3A连接器)来实现。
-
协议与生态:
- POSIX兼容性:绝大多数企业级应用(Oracle数据库、SAP、传统ERP)都基于POSIX文件系统开发,直接将这些应用的数据库文件放在对象存储上是极其困难甚至不可行的,虽然可以通过NFS(网络文件系统)网关(如AWS FSx for Lustre或NetApp ONTAP)将对象存储挂载成文件系统,但这会引入性能损耗和复杂性。
- 小块随机I/O:数据库的日志文件、索引文件等是典型的小块(4KB-64KB)随机写入,对象存储处理这类I/O效率很低,因为每个I/O都可能变成一个独立的HTTP请求,开销巨大。
对象存储会成为什么样的“主存储”?
| 维度 | 传统主存储(块/文件) | 对象存储主存储 |
|---|---|---|
| 核心场景 | 结构化数据、事务型数据库、低延迟应用 | 非结构化数据、云原生应用、大数据、AI/ML |
| 性能指标 | 低延迟(微秒级)、高IOPS、强一致性 | 高吞吐(GB/s级)、水平扩展、S3协议 |
| 典型硬件 | 全闪存阵列、SAS SSD | 全闪存NVMe节点、标准x86服务器、低成本HDD混合 |
| 代表性产品 | Dell EMC PowerStore, NetApp AFF, Pure Storage | AWS S3, MinIO, Ceph, Azure Blob |
| 未来地位 | 高性能“计算引擎”的主存储(如核心数据库) | 海量“数据资产”的主存储(如数据湖、AI数据) |
最终结论:
- 对象存储不会完全替代块/文件存储,核心关系型数据库、延迟敏感的交易系统、HPC计算节点等场景,仍会长期依赖高性能块/文件存储。
- 对象存储将成为“新主存储”,对于超过80%的非结构化数据增长(AI、IoT、视频、云原生应用),对象存储凭借其弹性、成本、生态优势,正成为生产环境的绝对主存储。
- 混合主存储架构是未来,一个现代化数据中心,会是“块存储(跑核心数据库)+ 文件存储(跑共享工作负载)+ 对象存储(跑数据湖和云原生应用)”并存的局面。
一句话总结:对于云原生和AI/ML的世界,对象存储已经是主存储;对于传统核心数据库和HPC世界,它还是配角,但两者的边界正在模糊,对象存储在性能上的进击从未停止。