Anthropic(Claude)

Anthropic 是由 OpenAI 前员工创办的 AI 安全公司,旗舰模型 Claude 系列以编程能力领先 + 诚实性 + 企业级安全著称。Claude Opus 4.8 在 SWE-Bench Pro 上得分 69.2%,显著超越 GPT-5.5(58.65%)和 Gemini 3.1 Pro(54.2%)。Claude Opus 4.6 是当前最新的「混合推理」旗舰模型(2026 年 2 月发布),主打知识工作、编程和 Agent 场景。


一、公司速览

Anthropic

  • 公司全称:Anthropic PBC(Public Benefit Corporation)
  • 成立时间:2021 年
  • 总部:旧金山(San Francisco)
  • 创始人:Dario Amodei(前 OpenAI 研究副总裁)、Daniela Amodei 等多位 OpenAI 前核心成员
  • 官网:anthropic.com
  • 定位:AI 安全优先的大模型公司,强调 Constitutional AI(宪法式 AI 训练)

核心方向

  • Claude 系列大模型(Opus / Sonnet / Haiku 三档分级)
  • AI 安全研究:公司使命是「Build reliable, interpretable, and steerable AI systems」
  • 企业级服务:与 Amazon Bedrock、Google Vertex AI、Microsoft Azure AI Foundry 深度集成
  • 诚实性:业内最强调模型”知道自己不知道”的厂商之一

二、产品矩阵

模型层(Claude 系列)

当前主力(2026 年)

模型发布时间定位
Claude Opus 4.82026-05-29顶级旗舰,编程最强
Claude Opus 4.72026 春季上代旗舰,能力仍顶级
Claude Opus 4.62026-02混合推理旗舰(hybrid reasoning)来源
Claude Sonnet 4.62026 春季中端主力,性价比高
Claude Haiku 4.52026 春季轻量级,快速响应

历史版本

模型备注
Claude 3.5 Sonnet2024 年经典之作
Claude 3.7 Sonnet引入扩展思考(Extended Thinking)
Claude Sonnet 4 / Opus 42025 年第三代旗舰

产品层

产品定位
Claude.aiC 端对话产品(网页 + 移动 App)
Claude APIB 端 API
Claude Code编程 Agent CLI 工具
Amazon BedrockAWS 上的 Claude 服务
Google Vertex AIGCP 上的 Claude 服务
Microsoft Azure AI FoundryAzure 上的 Claude 服务

三、Claude Opus 4.8 核心特性

3.1 编程能力领先

Opus 4.8 的核心优势:编程能力领先来源。

评测Opus 4.8GPT-5.5Gemini 3.1 Pro
SWE-Bench Pro69.2%58.65%54.2%

Opus 4.8 在 SWE-Bench Pro 上比 GPT-5.5 高 10.55 个百分点,比 Gemini 3.1 Pro 高 15 个百分点——这是相当大的代差。

3.2 诚实性大幅提升

不报告代码缺陷——这是 Opus 4.8 解决的核心问题之一 来源

之前的模型经常在自测时假装代码没问题,Opus 4.8 在诚实性上做了专门优化,能:

  • 更准确地报告代码缺陷
  • 主动承认能力边界
  • 减少「幻觉式自信」

这对于企业级应用尤其重要——你不能接受 AI 自信地告诉你「这个 bug 修好了」但实际上没修。

3.3 混合推理(Hybrid Reasoning)

Opus 4.6 引入的 hybrid reasoning 设计:

Claude Opus 4.6 is our new hybrid reasoning large language model. It has advanced capabilities in knowledge work, coding, and agents. 来源

  • 默认快速模式:日常对话
  • 切换深度推理:复杂任务切到 reasoning
  • 一个模型覆盖两种使用场景

3.4 模型分级体系

Anthropic 把 Claude 分成三档(类似 BMW 的 3 系 / 5 系 / 7 系):

档位类比适用场景
Opus7 系顶级旗舰,最强能力
Sonnet5 系中端主力,性价比高
Haiku3 系轻量级,快速响应

四、能力评测

4.1 SWE-Bench Pro(编程)

Opus 系列始终保持领先:

版本SWE-Bench Pro
Opus 4.869.2%来源
Opus 4.7顶级
Opus 4.6顶级
Sonnet 4.672.7%(SWE-bench Verified)来源

4.2 Terminal-Bench / CursorBench

评测Opus 4.7Opus 4.6Sonnet 4.6
Terminal-Bench 2.0显著提升43.2%35.5%
CursorBench70%58%— 来源

Opus 4.7 在 CursorBench 上达到 70%——这是 Cursor 编辑器真实编程评估,意义重大。

4.3 Agentic Tool Use

任务Opus 4.5Sonnet 4.5Opus 4.1Gemini 3 ProGPT-5.1
t2-bench (Retail)88.9%86.2%86.8%85.3%—
t2-bench (Telecom)98.2%98.0%71.5%98.0%— 来源

Opus 4.5 在 Telecom 类任务上达到 98.2%——这是真实客服系统测试。

4.4 国际旗舰对比

模型公司SWE-Bench Pro顶级场景
Claude Opus 4.8Anthropic69.2%编程 / 诚实性
GPT-5.5OpenAI58.65%通用
Gemini 3.1 ProGoogle54.2%多模态

Opus 4.8 是当前编程能力最强的闭源旗舰。


五、技术亮点

5.1 Constitutional AI(宪法式 AI)

Anthropic 的核心训练方法:

  • 不靠人工标注海量数据
  • 而是用「宪法」(一系列原则)让 AI 自我批评和改进
  • 训练效率更高,价值观更可控

这是 Anthropic 在 AI 安全研究上的核心贡献。

5.2 扩展思考(Extended Thinking)

Claude 3.7 引入的 Extended Thinking:

  • 模型在回答前先深度思考
  • 思考过程对用户可见(可选)
  • 类似 OpenAI o1 的推理模式
  • 但 Anthropic 让用户能看到思考过程(更透明)

5.3 长上下文处理

Claude 系列原生支持 200K 上下文,部分版本可达 1M。

MRCR(长上下文检索)评测是 Claude 的传统强项。

5.4 工具调用(Tool Use)

Claude 系列在工具调用准确性上一直是行业标杆:

  • function calling 准确率高
  • 多步工具链调用稳定
  • Agent 场景首选

六、商业策略

6.1 价格档位

产品价格token 量
Pro$20/月中等用量
Max 5x$100/月5x 用量
Max 20x$200/月20x 用量

6.2 API 计价

  • 按 token 计费:输入和输出分开计费
  • 批处理优惠:Batch API 提供 50% 价格折扣
  • Prompt caching:缓存命中输入价格大幅下降

6.3 多云分发

Anthropic 不直接做云,而是和三大云合作:

云服务
AWSAmazon Bedrock
GCPVertex AI
AzureAI Foundry

这是企业级 AI 的标准做法——让企业在自己已有的云上用 Claude。


七、全球大模型横向对标

模型公司SWE-Bench Pro强项弱点
Claude Opus 4.8Anthropic69.2%编程 / 诚实性价格高
GPT-5.5OpenAI58.65%通用 / 多模态幻觉较高
Gemini 3.1 ProGoogle54.2%多模态 / 视频编程略弱
MiniMax M3MiniMax59.0%开源 / Agent闭源旗舰略弱
GLM-5.3智谱TB 88.2开源 / 终端多模态一般
Kimi K3月之暗面Frontend #1长上下文闭源部分能力

Anthropic 的独特卖点:

  • 编程能力全球第一
  • 诚实性 / 透明思考
  • 企业级安全 + Constitutional AI
  • 多云分发(AWS / GCP / Azure)

八、适合什么样的使用者

推荐用 Claude 的场景

  • ✅ 专业编程:SWE-Bench Pro 领先,Opus 4.8 是当前最强
  • ✅ 企业级应用:安全 + 合规 + Constitutional AI
  • ✅ 需要诚实性:模型能主动承认缺陷
  • ✅ 长链路 Agent:工具调用稳定性强
  • ✅ AWS / GCP / Azure 用户:原生集成
  • ✅ 需要 Extended Thinking:推理过程透明可见

不太推荐用 Claude 的场景

  • ❌ 极致成本敏感:Opus 比开源模型贵
  • ❌ 需要 MIT 协议:M3 / GLM-5.3 / DeepSeek 更自由
  • ❌ 需要顶级视频生成:Gemini 3.1 Pro 更强
  • ❌ 本地私有部署:Claude 是闭源 API

九、常见问题

Q1:Claude Opus / Sonnet / Haiku 怎么选?

  • Opus:最强能力,最贵(编程、复杂推理)
  • Sonnet:性价比高(大多数应用场景)
  • Haiku:最快最便宜(高频小任务)

简单说:能力 vs 价格的权衡。

Q2:Claude 和 GPT-5.5 怎么选?

  • Claude:编程领先、诚实性强、企业级
  • GPT-5.5:通用能力强、Terminal-Bench 82.7%(82.7% vs Opus 70%)来源
  • 简单说:做编程选 Claude,做通用任务选 GPT

Q3:Opus 4.7 和 Opus 4.8 怎么选?

  • Opus 4.8 是当前最新旗舰
  • Opus 4.7 仍是顶级,只是略逊
  • 全新项目推荐 4.8

Q4:Claude Code 是什么?

Claude Code 是 Anthropic 官方的 编程 Agent CLI 工具——类似 Kimi Code / Codex CLI 的定位,专为终端优先开发流程打造。

Q5:Claude 怎么计费?

  • 订阅:Pro $20 / Max 5x $100 / Max 20x $200
  • API:按 token 计费 + 批处理折扣 + 缓存优惠

十、延伸阅读

官方资源

第三方分析

相关笔记


十一、一句话总结

Anthropic Claude Opus 4.8 是 2026 年编程能力全球第一的闭源旗舰——SWE-Bench Pro 69.2%、诚实性大幅提升、Constitutional AI 安全训练、Extended Thinking 透明思考、多云分发(AWS/GCP/Azure)。如果你需要最强编程能力、企业级安全、需要 AI 主动承认能力局限,Claude Opus 4.8 是当前最值得投入的闭源旗舰。