本文目录导读:

- 冷启动问题的“终极解决方案”走向成熟
- 与AI/GPU工作负载的深度融合(这是最大的趋势)
- 更强的计算边界与“Serverless化”趋势
- 成本模型的进一步优化与可预测性
- 开发体验与工具链的持续进化
- 当前Serverless的几大趋势
Serverless领域在近一两年(2023-2024年)确实有不少值得关注的新进展,主要集中在性能与冷启动优化、新型计算范式(尤其是AI集成)、成本与资源效率以及开发体验这几个方面。
以下是几个核心新进展:
冷启动问题的“终极解决方案”走向成熟
曾几何时,冷启动延迟是Serverless最大的痛点,各大云厂商和开源社区已经基本解决了这个问题。
- 快照与恢复技术(Snapshot & Restore): 这是目前最主流的技术,AWS Lambda 和 V8 isolate 技术、Cloudflare Workers 都支持将函数执行环境(包括内存中的状态、连接池等)序列化为快照,下次请求时直接恢复,而不是从头初始化,这可以将冷启动时间缩短到毫秒级(甚至1ms以下)。
- 运行时预置池: 云厂商会维护一个与用户函数配置(内存、架构等)匹配的“热”运行时池,当新请求到来时,直接从这个池子里拿一个已经启动好的实例,用户几乎感知不到冷启动。
- 微虚拟机(MicroVM)优化: AWS Lambda 和 Firecracker 持续优化,使得创建一个微虚拟机的开销极低,即便是Java、.NET这类启动重的语言,冷启动也基本不再是问题。
与AI/GPU工作负载的深度融合(这是最大的趋势)
Serverless正在向GPU密集型任务和AI推理场景强力渗透,这改变了过去“Serverless只适合轻量、I/O密集任务”的认知。
- GPU作为Serverless资源: 主流云厂商(如AWS、Google Cloud、Azure)和新兴平台(如RunPod、Banana Dev、Replicate)都提供了按需GPU调用的Serverless方案,你可以为模型推理创建一个函数,在请求到来时才加载模型并启动GPU实例,处理完立即释放,计费精确到秒或毫秒。
- AI推理加速与模型优化: 专门为Serverless环境设计了模型加载缓存、请求批处理(batching) 等机制,当一个GPU实例被多个并发请求共享时,平台会自动将请求合并为一个批次进行推理,大幅提升吞吐量并降低成本。
- Serverless LLM(大语言模型)部署: 像Hugging Face的推理端点、RunPod的Serverless GPU,都允许你部署Llama 2、Mistral、Stable Diffusion等大模型,你无需管理复杂的Kubernetes集群和GPU卡,只需上传模型或指定模型ID,平台会自动处理扩缩容、负载均衡、冷启动等问题。
- 事件驱动的AI工作流: 将Serverless函数与AI服务(如图像识别、自然语言处理)结合,构建事件驱动的AI流水线,用户上传图片 -> 触发Serverless函数 -> 调用AI模型进行识别 -> 结果存入数据库。
更强的计算边界与“Serverless化”趋势
Serverless的概念正在超越传统的FaaS(函数即服务),延伸到更复杂的计算类型。
- Serverless容器: AWS Fargate、Google Cloud Run、Azure Container Apps 已经非常成熟,它们让你“只关心容器镜像,不关心集群”,你可以运行状态长期、端口监听的服务(如Web应用、后端API),而平台自动管理扩缩容和计费,这比传统的Kubernetes更简单。
- Serverless数据库: 数据库的Serverless化(如Aurora Serverless v2、Cloud Spanner、PlanetScale、Neon)实现了存储与计算分离,并且能根据负载自动、无感地扩缩算力,你可以创建一个数据库实例,它从0个ACU(Aurora Capacity Unit)开始,有请求时瞬间拉起,空闲时缩回0,按实际使用的读取/写入量计费。
- Serverless工作流/状态管理: AWS Step Functions、Azure Logic Apps、Temporal.io(与Serverless结合) 让你能用声明式的方式编排多个Serverless函数、API调用、人工审批步骤,这解决了FaaS“无状态”带来的编排难题,让复杂业务流程变得简单。
成本模型的进一步优化与可预测性
用户对成本的抱怨一直是Serverless的弱点(请求量虽小但处理时间长导致费用高),新进展正在改善这一点:
- 更细粒度的计费单位: 从过去的100ms步进,变成1ms步进(如AWS Lambda、Cloudflare Workers),这意味着一个耗时50ms的请求,你只需为50ms付费,而不是100ms。
- 预留并发与预置并发: 允许用户“购买”一定量的并发实例(按小时或按月付费),保证其始终处于热状态,同时享受Serverless的弹性,这样可以混合使用“低成本、但有冷启动风险”的按需实例和“高成本、但零延迟”的预置实例,平衡成本和性能。
- “无服务器函数”与“托管服务”的混合计费: 许多平台将数据库、对象存储、消息队列等托管服务与FaaS深度集成,这些服务间的数据传输和调用通常免费或价格极低,鼓励用户采用事件驱动架构。
开发体验与工具链的持续进化
- 更好的本地调试: AWS SAM、Serverless Framework、Azure Functions Core Tools、LocalStack等工具已经能非常逼真地模拟云环境,你可以像调试本地服务一样,断点调试Serverless函数、查看日志、模拟事件源。
- 基础设施即代码(IaC)的深度整合: Terraform、Pulumi、CDK(如AWS CDK)是现代Serverless应用的标配,你可以用编程语言(TypeScript, Python, Go)直接定义整个Serverless应用(函数、触发器、数据库、API网关),并像管理代码一样管理基础设施。
- 无服务器后端框架(如Winglang, Ampt): 一些新兴的专用语言或框架试图构建一个“完全屏蔽云概念”的抽象层,你只需要写业务逻辑,框架自动为你生成必要的云资源(如API Gateway、DynamoDB表、IAM角色),并处理部署、日志、监控。
当前Serverless的几大趋势
- 冷启动不再是障碍:快照、预置池等技术让冷启动几乎无感知。
- AI是最大增量:GPU被纳入Serverless资源,LLM推理和AI工作流成为核心场景。
- 边界在扩大:Serverless从函数扩展到容器、数据库、工作流、状态管理。
- 成本更可控:1ms计费、预留并发、混合计费模型让成本变得更可预测。
- 开发者体验逼近本地开发:本地模拟、IaC、一键部署成为标配。
对于开发者来说,这意味着:
- 你可以更放心地使用Serverless构建核心业务,而不再担心冷启动和性能瓶颈。
- 你无需再为AI/ML工作负载管理复杂的GPU集群,Serverless将简化这一过程。
- 你的应用架构可以变得更“事件驱动”和“无服务器化”,充分利用按需付费和自动扩缩容的优势。
如果你正在处理AI推理、高并发API、事件驱动架构、或者希望降低基础设施运维成本,现在的Serverless生态确实比过去成熟和强大得多。