Segment Anything AI(SAM)
免费
Segment Anything (SAM) 是 Meta AI(FAIR)开源的图像与视频分割基础模型,支持点、框、文本等灵活提示方式,可零样本分割任意物体。SA-1B 数据集包含 11M 图像与 11 亿掩码。
Segment Anything AI(SAM)
核心参数与统计
Segment Anything 是 Meta AI(FAIR)在 2023 年 4 月推出的图像分割基础模型,核心创新在于将分割任务从"训练特定模型分割特定类别"转变为"提示任意模型即可分割任意物体"。2024 年 7 月发布的 SAM 2 进一步将这一能力扩展到视频领域。
| 项目 | 公开信息 |
|---|---|
| 开发机构 | Meta AI(FAIR) |
| 首次发布 | SAM 1.0(2023-04-05)/ SAM 2.0(2024-07-29) |
| 开源许可 | Apache 2.0 |
| 核心架构 | Vision Transformer(ViT)+ 轻量 Mask Decoder |
| 训练数据 | SA-1B(11M 图像1.1B 掩码);SA-V(视频分割数据集) |
| 模型规格 | ViT-B(~91M)、ViT-L(~308M)、ViT-H(~637M) |
| 提示方式 | 点、框、掩码、文本(通过 CLIP 等模型对齐) |
| 输出 | 多层级掩码(whole/part/subpart)、IoU 评分、稳定性评分 |
| GitHub Stars | SAM 约 54.6k / SAM 2 约 25k+ |
| 社区 Forks | SAM 约 6.4k / SAM 2 约 3.6k |
参数解读:SAM 的三个模型规格覆盖了精度与速度的不同平衡点。ViT-B(91M 参数)可在消费级 GPU 上实时推理,适合高吞吐在线服务;ViT-H(637M 参数)提供最佳分割质量,适合离线的科研或高精度标注场景。解码器仅 4MB 左右,意味着大部分计算量在图像编码阶段,一次编码后可以反复用不同提示查询分割结果——这是 SAM 在交互式场景中体验流畅的根本原因。
用户与市场认可
SAM 的行业影响力远超一般的开源模型,已经成为计算机视觉领域"分割"任务的标配参考点。
- 学术界引用:截至 2026 年中,SAM 论文(arXiv:2304.02643)累计引用超过 10,000 次,Google Scholar 统计长期处于 CV 领域当年引用前列。SAM 2 论文(arXiv:2408.00714)发布不到两年也已积累数千引用。
- 开源生态渗透:SAM 官方仓库 54.6k Stars、SAM 2 超 25k Stars,两个仓库合计 80k+ Stars,是 Meta AI 最受欢迎的项目之一。社区衍生项目包括 Grounding SAM(接地 SAM,融合文本提示)、LangSAM(自然语言驱动的 SAM)、SAM-Track(视频跟踪)等,形成围绕 SAM 的"分割生态圈"。
- 行业落地:Adobe Photoshop 的"对象选择"工具Roboflow 的数据标注平台Labelbox、Segments.ai 等数据标注工具均深度集成 SAM 作为辅助标注引擎。医疗影像分析(如病理切片CT 分割)、遥感解译、工业缺陷检测等垂直领域均有大量基于 SAM 二次开发的案例。
- 企业采用:AWS 通过 SageMaker 提供 SAM 推理镜像Hugging Face 提供 Spaces 托管 Demo、Replicate 提供付费 API。各主流云平台均将 SAM 纳入其 AI 服务目录。
不确定性说明:上述引用数为第三方学术数据库统计,非 Meta 官方发布;企业采用信息来源于公开案例与产品公告,不构成全面覆盖。
成本优势
SAM 的"成本结构"从模型本身的使用方式出发,需要区分 C 端交互API 调用与私有化部署三个层次。
| 维度 | 成本说明 |
|---|---|
| C 端(官网 Demo) | 完全免费,无注册要求,单次使用无需付费,但受限于 Demo 页面的算力配额与图像尺寸 |
| API 层(第三方托管) | 通过 Replicate、Hugging Face Inference Endpoints、AWS SageMaker 等平台调用,按推理时间或请求次数计费,平均每张图像分割成本在 $0.001-$0.01 量级 |
| 私有化部署 | 模型权重免费(Apache 2.0),成本主要为 GPU 基础设施(推理需 GPU:ViT-B 约 3GB VRAM、ViT-H 约 10GB VRAM),自建集群则取决于规模;边缘端可通过模型量化部署到 Jetson 等设备 |
与商业替代方案对比:传统语义分割模型(如 DeepLabV3+、 Mask R-CNN)需要针对特定类别收集标注数据、训练专用模型,单项目的标注+训练成本在数千到数万美元不等。SAM 以零样本方式省去标注和训练有节,对长尾类别或快速原型验证场景的成本优势极其显著。但需要说明的是,SAM 的分割输出是"物体"级而非"语义"级——它不告诉你分割出的是什么类别,因此在需要分类语义标签的场景下,仍需搭配分类模型或 CLIP 等方案。
开发者/API 层:通过第三方托管平台调用 SAM 的 API 成本极低,适合低频使用或原型验证阶段。高频场景建议自建推理服务,利用 batch 推理和多卡并行降低单次成本。
企业/私有化层:企业需自行承担 GPU 算力开支。推理 SAM 模型不需要 A100/H100 级别——一张 RTX 3090/4090 可以高效运行 ViT-B 和 ViT-L,ViT-H 建议 A10 或 A100 以达到最佳吞吐。长期运行需纳入能耗和运维成本。开源模型本身无授权费,总拥有成本主要受吞吐量和可用性要求驱动。
主要功能
-
可提示分割(Promptable Segmentation):用户通过点(正/负样本)、框(边界框)、或粗略掩码来提示 SAM 分割目标物体。这是 SAM 的核心能力——一次图像编码后,可以在毫秒级响应不同提示,实现实时交互式分割。适用任务:数据标注、图像编辑、交互式修图。
-
全图自动分割(Automatic Mask Generation):通过预定义的点网格在全图上自动生成所有物体的掩码,输出带 IoU 评分和稳定性评分的多层级掩码(whole/part/subpart)。适用任务:一次性全图解析、大规模数据集的预标注、场景理解。
-
视频对象分割(SAM 2 新增):将分割能力扩展到视频,通过 Streaming Memory 机制实现帧间的对象跟踪与掩码传播。支持交互式(手动修正中间帧)和自动(首帧提示后全视频跟踪)两种模式。适用任务:视频编辑、目标跟踪、视频标注。
-
零样本跨域迁移:SAM 在 SA-1B 这一大规模通用数据集上训练,对未见过的物体类别、场景和图像域具有泛化能力。医疗影像、卫星遥感、显微镜图像等专业领域不需要微调即可直接使用。适用任务:医学影像分析、遥感解译、工业质检、考古文物重建。
-
多模态提示扩展(社区生态):官方支持点/框提示,社区通过 Grounding DINO + SAM(Grounding SAM)和 CLIP + SAM(LangSAM)实现了文本提示驱动分割。用户输入"分割那只白色的狗",系统通过文本-图像对齐自动生成框或点,再交由 SAM 完成精细分割。适用任务:文本驱动的交互式编辑、自动化流水线。
隐藏联动分析:SAM 真正的价值不在于单次分割的精度,而在于"一次编码、多次查询"的计算范式对工作流的重新定义。在数据标注场景中,标注员对同一张图像的一次编码结果可以反复应用不同提示来标注不同物体,将原本每次标注都需要完整模型推理的流程缩减为一次编码 + 多次轻量解码,整体标注吞吐提升 5-10 倍。在 AI 修图产品(如 Adobe Photoshop)中,SAM 被嵌入选择工具的底层,用户一次点击即可选中物体,然后叠加生成式填充(Generative Fill)完成修复——这是"分割 + 生成"两条基础模型流水线的协同典型案例。
模型与版本演进
SAM 的版本脉络清晰,从图像到视频、从在线 Demo 到离线 SDK,经历了完整的进化路径。
SAM 1.0(2023-04-05):奠基版本。提出"可提示分割"的任务范式,发布 SA-1B 数据集(11M 图像1.1B 掩码),采用 ViT 图像编码器 + 提示编码器 + 轻量 Mask Decoder 的三段式架构。模型权重和全部代码以 Apache 2.0 许可开源。早期限制:仅支持图像,无视频能力;自动分割模式在复杂场景中可能出现漏分割或过分割。
SAM 2.0(2024-07-29):重大升级。核心突破是将分割从图像扩展到视频,引入 Streaming Memory 架构来保持帧间一致性,同时保持对图像分割的完全兼容。发布 SA-V 数据集,包含约 35K 视频片段和逾 5M 掩码标注。性能方面,SAM 2 在视频分割任务上的 J&F 指标超越此前专用方法,同时在图像分割上与 SAM 1.0 持平或更优。架构上,SAM 2 统一了图像和视频的处理逻辑——将图像视为单帧视频。
SAM 2.1(~2025-Q1):小步优化。主要改进包括:提升视频分割中的严重遮挡场景下的跟踪鲁棒性、优化帧间掩码传播的质量一致性、更新 SA-V 数据集的部分质量修正。功能接口与 SAM 2.0 保持兼容。
社区衍生版本:
- Grounding SAM:集成 Grounding DINO 文本检测,实现文本到分割的端到端流水线。
- LangSAM:轻量级文本提示实现,适合快速集成。
- SAM-Track:为视频对象跟踪优化的 SAM 2 定制版本,增强多目标 ID 保持能力。
- MedSAM:专门针对医学影像优化的 SAM 微调版本,在特定解剖结构分割上超越通用 SAM。
技术优势
三段式解耦架构是效率关键。SAM 将分割拆分为图像编码器(ViT,一次编码)、提示编码器(可多次查询)、掩码解码器(轻量 Transformer,毫秒级响应)三个模块。这种解耦使交互式分割的计算成本集中在首次图像编码上——用户在一张图上标注多个物体时,后续每次操作仅需经过提示编码器和解码器,计算量降低 1-2 个数量级。Adobe 等产品正是利用这一特性实现了"点击即选"的实时体验。
数据引擎(Data Engine)闭有是 SAM 模型质量的秘密武器。Meta 构建了一个"模型辅助标注 → 人工修正 → 再训练"的迭代循有,在半自动模式下从 120K 原始图像扩展到 11M 图像的生产规模。每一轮迭代中,模型负责初版预测,标注员修正错误,修正后的更高质量数据用于训练下一版模型。这种主动学习式的数据飞轮使得 SAM 的掩码质量和覆盖度呈螺旋上升。
Streaming Memory 实现视频分割(SAM 2)。与传统视频分割方法需要处理完整视频序列不同,SAM 2 引入 Streaming Memory(流式记忆模块)仅在时间窗口内保持帧间一致性的上下文状态。这使得模型可以处理任意长度视频,且推理延迟不随帧数增长——每一帧的处理时间恒定。记忆机制包括对已跟踪物体的"记忆编码"和对当前帧的"记忆注意力",在保持长程跟踪的同时规避了全局注意力随帧数平方增长的复杂度。
零样本泛化能力来自数据规模而非架构设计。SAM 强大的零样本能力主要归功于 SA-1B 的数据规模和多样性——11M 图像1.1B 掩码覆盖了几乎所有日常可见的物体类别和场景类型。架构上的 ViT + Transformer 是已经被验证的通用架构。换句话说,SAM 的泛化能力是"学"出来的而不是"设计"出来的,这意味着它对训练分布之外的极端域(如太空天文图像、微观原子结构)的泛化效果可能不如在自然图像中稳定。
参数效率:SAM 的 Mask Decoder 仅约 4MB(约 8M 参数),是整个模型中最小却最关键的模块。它在特征嵌入空间中进行掩码预测,通过动态 MLP 将提示映射到图像特征,然后逐层上采样到全分辨率。这种轻量设计是实时交互体验的前提。
如何使用
SAM 的接入方式覆盖了从入门 Demo 到生产级 API 到私有化部署的全链路。
| 入口 | 适用场景 | 访问方式 |
|---|---|---|
| 官网 Demo | 快速体验、单图交互 | https://segment-anything.com/demo |
| SAM 2 Demo | 视频分割体验 | https://sam2.metademolab.com |
| Hugging Face Spaces | 在线推理、模型测试 | 搜索 "segment-anything" |
| Replicate API | 产品集成、原型验证 | 按请求付费 |
| AWS SageMaker | 企业级推理服务 | AWS 控制台部署推理端点 |
| 本地部署 | 高吞吐、隐私合规 | pip install segment-anything + 下载权重 |
本地部署典型步骤:
# 安装
pip install git+https://github.com/facebookresearch/segment-anything.git
# 下载模型权重(以 ViT-B 为例)
wget https://dl.fbaipublicfiles.com/segment_anything/sam_vit_b_01ec64.pth
# Python 调用示例
from segment_anything import sam_model_registry, SamPredictor
import cv2
sam = sam_model_registry["vit_b"](checkpoint="sam_vit_b_01ec64.pth")
predictor = SamPredictor(sam)
image = cv2.imread("input.jpg")
predictor.set_image(image)
# 通过点提示分割
masks, scores, logits = predictor.predict(
point_coords=[[500, 375]],
point_labels=[1], # 1 表示前景
multimask_output=True # 返回多个候选掩码
)
SAM 2 视频分割典型流程:
pip install git+https://github.com/facebookresearch/segment-anything-2.git
# 自动生成视频首帧掩码并做全视频跟踪
python scripts/sam2_video_predict.py \
--model-type vit_l \
--checkpoint sam2_l.pt \
--video-path /path/to/video \
--output-path /path/to/output
第三方托管 API 示例(Replicate):
import replicate
output = replicate.run(
"meta/segment-anything:...",
input={"image": open("photo.jpg", "rb")}
)
# 直接获取分割掩码结果
典型使用流程:选择接入方式 → 加载图像 → 编码图像特征 → 输入提示(点/框/文本)→ 获取分割掩码 → 后处理(阈值NMS、格式转换)。在交互式应用中,"编码图像特征"这一步仅需执行一次。
产品定价
SAM 模型的定价逻辑比较特殊——模型本身是完全免费的(Apache 2.0),成本主要取决于"谁来承担 GPU 算力"。
C 端(零成本路径):
- 官网 Demo:免费,无需注册,无使用配额公开限制。适合零星使用、效果验证。
- Hugging Face Spaces 上众多社区 Demo:免费,但受限于共享 GPU 算力,高峰期排队。
开发者/API 路径(按用量计费):
- Replicate:SAM 推理约 $0.002/次(取决于输入图像尺寸),SAM 2 视频推理按时长计费。
- Hugging Face Inference Endpoints:按实例时长 + 请求量计费,自选 GPU 类型(T4/A10G/A100)。
- AWS SageMaker:EC2 实例费用 + 推理容器部署费用,可通过 Auto Scaling 控制成本。
企业/私有化路径(基础设施成本):
- 模型权重:免费。
- 推理硬件:ViT-B 可在 4GB VRAM GPU 上运行,推荐 T4($0.35/小时)即可;ViT-H 建议 A10($0.70/小时)或 A100($1.2+/小时)。
- 批量推理优化:通过 PyTorch Compile、FP16/INT8 量化TensorRT 等方式可将吞吐提升 2-4 倍,进一步降低分摊成本。
对比商业替代方案:商业图像分割 API(如 Google Cloud Vision、AWS Rekognition)按单次 API 调用收费,对象检测与分割约 $1.5/千次。SAM 自建模式在高频场景下成本更低——以日处理 10 万张图像为例,自建集群分摊后单张成本可降至 $0.0002-0.0005。
应用场景
-
数据标注与数据集构建:SAM 加速人工标注的效率提升是最直接的受益场景。标注员只需点击物体上的一点,SAM 即可给出完整掩码,配合人工微调即可完成标注。传统多边形标注每张图需 30-90 秒,SAM 辅助下降至 5-15 秒。对于需要构建大规模分割数据集的团队,SAM 的自动掩码生成功能还可用于预标注,人工仅需修正。典型行业:自动驾驶标注、医学影像标注、电商商品标注。
-
计算机视觉应用开发:在需要"识别并分割特定物体"的产品中,SAM 作为基础感知组件嵌入。典型链路:目标检测器(如 YOLO)提供物体位置框 → SAM 提供精细掩码 → 后续应用层(背景替换、广告植入、图像合成)完成编辑。相比传统方案省去了为每个场景标注和训练分割模型的步骤。典型产品:AI 修图 App、视频编辑软件、电商一键去背景。
-
医学影像分析:SAM 在医学影像领域的应用是直观的零样本迁移场景。CT、MRI、X 光影像中的解剖结构(器官、血管、病灶)与自然图像差异极大,但 SAM 凭借 SA-1B 训练中获取的形状先验,可以直接对医学影像中的结构给出合理的初始分割结果。典型案例:研究人员在 MICCAI 2023/2024 的多个挑战赛中验证了 SAM 在肺结节、视网膜血管、细胞核等结构上的零样本分割效果。注意:医学场景需要配合人工审核,不建议直接用于临床。
-
遥感与地理空间分析:卫星影像和航空图像中的建筑物、道路、植被、水体等目标的分割是遥感分析的常见需求。SAM 在全图自动分割模式下可以直接输出遥感影像的物体级掩码,减少传统基于像元分类或面向对象分割的繁琐流程。典型收益:单个区域的建筑物覆盖率估算、变化检测、土地利用分类的预标注阶段。
-
视频编辑与后期制作:SAM 2 的视频分割能力使视频级的目标选择成为可能——用户只需在第一帧提示目标物体,模型即可在后续帧中持续跟踪并分割。在视频剪辑、广告特效、虚拟背景替换等场景中,这一能力消除了逐帧手动抠像的重复劳动。典型产品:Runway、Adobe Premiere 的 AI 选择工具、短视频一键换背景。
-
工业缺陷检测:在生产线上,SAM 可对产品表面缺陷(划痕、凹陷、污渍)进行零样本分割。由于缺陷形态多样且每个类别的缺陷样本稀少,传统的监督学习方法面临标注不足的问题,SAM 的零样本能力恰好填补了这一缺口。典型流程:端到端系统先用 SAM 分割图像中的异常区域,再通过小样本分类器判断缺陷类别。
适用人群
-
计算机视觉研究人员与算法工程师:SAM 提供了开箱即用的分割能力,适合作为基线模型、特征提取器或下游任务的预处理组件。研究团队可以基于 SAM 开发垂直领域专用版本(如 MedSAM),或将 SAM 与其他模型组合构建复合感知系统。不适配:需要极高分割精度且物体类别在 SAM 训练分布之外的专业领域(如高能物理粒子径迹、天文深空图像),可能不如微调后的专用模型。
-
数据标注团队与企业:SAM 辅助的数据标注工具将掩码标注效率提升 3-10 倍。标注平台(Labelbox、Segments.ai、Roboflow)均已集成 SAM 功能。前置条件:需要 GPU 推理资源,在完全离线的标注有境中部署 SAM 推理服务需 IT 团队配合。对于只需要分类标签(不需要像素级掩码)的标注项目,SAM 是过度工具。
-
AI 产品开发者与创业团队:在 AI 修图、视频编辑、电商设计等产品中嵌入 SAM 作为"分割引擎",可快速实现"选中任意物体"的产品能力。无需自研分割模型,可直接通过 Replicate API 或自建推理服务接入。不适配:产品核心交互是物体级别检测(如识别人脸、扫描二维码)而非精细分割时,选用 YOLO 等检测框架更合理。
-
医疗影像分析师与临床研究团队:SAM 对解剖结构和非典型病灶的零样本分割能力减轻了手动勾勒的工作量。注意:SAM 的预测结果不能直接用于临床诊断——它只提供形态学分割,不提供诊断判断。任何临床用途必须经过充分的验证和监管审批。
-
创意设计师与内容创作者:通过基于 SAM 的工具(如 Photoshop 的"对象选择"、Clipdrop Cleanup)可一键选中图像中的任意物体进行编辑或移除。门槛极低,零代码,无需 GPU 知识。不适配:需要完全自动的一键式抠图(没有手动提示或修正有节)的场景,商业专用抠图工具(如 Remove.bg)在垂直场景(如人像)上效果更稳定。
总结与展望
SAM 的核心竞争力在于它重新定义了计算机视觉中的"分割"任务——从"训练一个模型做特定分割"变为"问一个基础模型要一个掩码"。这种范式转变使分割能力下沉为 AI 产品的基础组件,就像文本嵌入或图像编码器一样成为基础设施。
当前限制:
- 语义缺失:SAM 只给出"是什么形状"的掩码,不回答"这是什么物体"。任何需要语义标签的场景都必须叠加分类模型,增加了系统复杂度。
- 边缘质量:在精细边缘(头发丝、透明物体、动物毛发)上,SAM 的分割精度不如商业专用修图工具的抠图引擎。对于追求像素级完美的电商产品图场景,需要人工修正。
- 视频长程漂移:SAM 2 在长视频(10 分钟以上)的跟踪中可能出现目标丢失后的不可恢复漂移,目前建议在关键帧设置人工确认点。
- 推理延迟:尽管交互式场景体验流畅(解码器毫秒级),但首次图像编码仍需数百毫秒(GPU 上),对毫秒级实时系统(如视频安防)来说仍然是不可忽略的延迟。
生态与商业化方向: Meta 选择 Apache 2.0 完整开源 SAM,商业意图不在于直接收费,而在于构建"Meta AI 生态"——SAM 是 Llama 系列之外 Meta 最成功的基础模型开源项目。围绕 SAM 的社区生态(Grounding SAM、LangSAM、SAM-Track 等)正在自发地生长为"视觉感知基础设施层"。
观察点:
- SAM 3 / SAM 4 是否会原生集成语义分类能力,从而成为真正的"视觉 LLaVA"?
- 边缘端部署的进一步量化优化能否让 SAM 在手机端IoT 设备上运行,打开新场景?
- 视频分割的质量能否在长视频场景中接近人工标注水平,这将决定 SAM 在影视工业化中的位置。
采购/采用风险评估:对于大多数技术团队,SAM 是"先用再说"的低风险投资——模型免费、开源、社区活跃、云平台随处可用。风险主要存在于:①对精度有严格 SLA 的商业化场景(如医疗诊断辅助中的分割质量要求),SAM 不能替代专业认证的算法;②大规模私有化部署前需要评估 GPU 集群成本是否低于商业 API 的调用费;③SAM 输出的掩码格式与现有数据管线的兼容性——SA-1B 使用 COCO RLE 格式,如果下游系统使用不同的标注格式,需要增加格式转换的工程开销。建议在生产有境中先以"旁路模式"(side-by-side 验证)运行 1-2 周,确认分割质量与吞吐满足核心指标,再逐步替换存量方案。
相关工具:Midjourney、
Stable Diffusion
版本信息
- SAM 2 :将分割能力从图像扩展到视频,引入 Streaming Memory 架构实现实时视频对象分割,发布 SA-V 数据集(最大视频分割数据集)。
- SAM :首次发布,提出可提示分割范式,发布 SA-1B(11M 图像1.1B 掩码),ViT 架构,Apache 2.0 开源。
- SAM 2.1 :SAM 2 的小幅改进版本,优化视频分割中的遮挡处理与跟踪稳定性,改进 SA-V 数据集质量。
用户评价