揭幕 Claude3：揭露 OpenAI 最大弱点

　　发布于2024-12-14　阅读（0）

扫一扫，手机访问

企业级 SOTA 大模型，Anthropic 的 Claude3 释放了哪些信号？

作者 | 宛辰

编辑 | 靖宇

作为 OpenAI GPT3 研发负责人的创业项目，Anthropic 被视为最能与 OpenAI 抗衡的一家创业公司。

Anthropic在当地时间周一发布了一组Claude 3系列大模型，声称其功能最强大的模型在各种基准测试中都胜过了OpenAI的GPT-4和Google的Gemini 1.0 Ultra。

但是，能处理更复杂的推理任务、更智能、更快响应，这些跻身大模型 Top3 的综合能力只是 Claude3 的基本功。

Anthropic 致力于成为企业客户的最佳拍档。

这是首先体现在 Claude3 是一组模型：Haiku、Sonnet 和 Opus，让企业客户根据自身场景选择不同性能、不同成本的版本。

其次，Anthropic 强调自家模型是最安全的。Anthropic 总裁 Daniela Amodei 介绍，在 Claude3 的训练中引入了一种叫做「宪法人工智能」的技术，增强其安全、可信、可靠。

爱丁堡大学大模型和推理方向博士生符尧在阅读完Claude3的技术报告后指出，Claude3在复杂推理的基准测试中表现出色，尤其在金融和医疗领域表现突出。作为一家ToB公司，Anthropic选择专注于优化最具盈利潜力的领域。

现在，Anthropic 在 159 个国家开放使用 Claude3 系列的两款模型（Haiku 和 Sonnet），最强版本 Opus 也即将推出。同时，Anthropic 也通过亚马逊和谷歌的云平台提供服务，后者曾分别向 Anthropic 注资 40 亿美元和 20 亿美元。

联合创始人 Dario Amodei and Daniela Amodei 表示，Claude 3 的发布再次表明，「Anthropic 更像是一家企业公司，而不是一家消费者公司。」｜图片来源：Anthropic

01、更智能、响应更快的 Claude3 家族：Opus、Sonnet 和 Haiku

据 Anthropic 官网，Claude3 是一系列模型，包含三种最先进的模型：Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus，允许用户为其特定应用选择智能、速度和成本的最佳平衡。

在模型的通用能力上，Anthropic 称 Claude 3 系列「为广泛的认知任务树立了新的行业基准」，在分析和预测、细致内容的生成、代码生成以及西班牙语、日语和法语等非英语语言对话方面，现实出更强大的能力，在任务响应上也更及时。

其中，Claude 3 Opus 是这组模型中最智能的模型，尤其在高度复杂的任务处理上。Opus 在大多数常见的评测基准中都优于同行，包括本科水平专家知识 (MMLU)、研究生水平专家推理 (GPQA)、基础数学 (GSM8K) 等。它在复杂任务上表现出接近人类水平的理解力和流畅性，是目前 Anthropic 对于通用智能最前沿的探索，「展示了生成式人工智能的外部极限」。

Claude3 模型家族｜图片来源：Anthropic

Claude 3 Sonnet 在智能水平和响应速度之间实现了理想的平衡，尤其对于企业场景下的任务。与同类产品相比，它以更低的成本提供了强大的性能，并且专为大规模人工智能部署中的高耐用性（high endurance）而设计。对于绝大多数工作负载，Sonnet 的速度比 Claude 2 和 Claude 2.1 快 2 倍，且智能水平更高。它擅长执行需要快速响应的任务，例如知识检索或销售自动化。

Claude 3 Haiku 是最紧凑的模型，并且也最具成本效益。并且，它的响应速度也很快，可以在不到三秒的时间内阅读 arXiv 上包含图表、图形的信息以及数据密集的研究论文（约 10k token）。

02、瞄准企业客户的迭代

联合创始人 Daniela Amodei 介绍，除了通用智能的进步，Anthropic 特别关注企业客户把生成式 AI 集成到他们的业务时，所面临的许多挑战。针对企业客户，Claude3 家族在视觉能力、准确性、长文本输入和安全方面，都有进步。

很多企业客户的知识库拥有多种格式，PDF、流程图或演示幻灯片。现在，Claude 3 系列模型可以处理各种视觉格式的内容，包括照片、图表、图形和技术图表。

Claude3 还优化了准确性和长文本窗口的能力。

在准确性上，Anthropic 使用了大量复杂的事实问题来针对当前模型中已知的弱点，将答案分为正确答案、错误答案（或幻觉）和承认不确定性。相应地，Claude3 模型表示它不知道答案，而不是提供不正确的信息。其中最强的版本 Claude 3 Opus 在具有挑战性的开放式问题上的准确性（或正确答案）上，比 Claude 2.1 提高了一倍，同时也减少了错误答案的水平。

相比 Claude2.1 版本，Claude3 系列全面提升了响应的准确性。｜图片来源：Anthropic

同时，由于语境理解能力的提升，Claude3 家族相比之前的版本，在响应用户任务上会作出更少的拒绝回答。

除了更准确的回复，Anthropic 称将在 Claude 3 带来「引用」功能，可以指向参考材料中的精确句子来验证他们的答案。

当前，Claude 3 系列模型将提供 200K token 的上下文窗口。后续，所有这三种模型都能够接受超过 100 万 token 的输入，这部分能力会提供给需要增强处理能力的精选客户。Anthropic 在技术报告中简单阐述了 Claude3 的上文本窗口能力，包括有效处理更长的上下文提示词，以及回忆能力。

03、「宪法人工智能」，应对「不精确的科学」

值得注意的是，Claude3 作为多模态模型，可以输入图像，但无法输出图像内容。联合创始人 Daniela Amodei 称，这是因为「我们发现企业对图像的需求要少得多」。

Claude3 的发布是在谷歌 Gemini 生成图片引发争议后发布的，面向企业客户的 Claude 也免不了在 AI 所引发的价值观偏见等问题上的控制与平衡。

对此，Dario Amodei 强调了控制人工智能模型的难度，称其为「不精确的科学」。他表示，该公司有专门的团队致力于评估和减轻模型带来的各种风险。

另一位联合创始人 Daniela Amodei 也承认，用目前的方法可能无法实现完全无偏见的人工智能。「创建一个完全中立的生成式人工智能工具几乎是不可能的，不仅在技术上，而且还因为并不是每个人都同意什么是中立。」她说。

此前，Anthropic 公布了用来对齐大模型的「宪法人工智能」｜图片来源：Anthropic

尽管如此，Anthropic 用一种称为「宪法人工智能」方法来尽可能使模型和人类广泛的价值观一致，模型遵循「宪法」中定义的原则来调整优化。

作为 OpenAI 曾经的核心人发人员，Amodei 兄妹的出走跟近日马斯克对 OpenAI 的一纸诉状有相同点，认为 OpenAI 不再是一个非赢利组织，不再遵循最初使命造福人类。有记者问 Amodei，Anthropic 符合你出走创业的愿景吗？

Amodei 说：「处于人工智能发展的前沿，是引导人工智能发展轨迹为社会带来积极成果的最有效方式。」

本文来自微信公众号：极客公园（ID：geekpark），作者：宛辰

本文转载于：https://www.ithome.com/0/754/714.htm 如有侵犯，请联系admin@zhengruan.com删除

上一篇：育碧游戏《看门狗》将被拍成真人电影

下一篇：优派发布新款 VX2776-2K-PRO 显示器：27英寸 185Hz Fast IPS，售价1599元

产品推荐

售后无忧
立即购买>

DAEMON Tools Lite 10【序列号终身授权 + 中文版 + Win】

￥150.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Ultra 5【序列号终身授权 + 中文版 + Win】

￥198.00
office旗舰店
售后无忧
立即购买>

DAEMON Tools Pro 8【序列号终身授权 + 中文版 + Win】

￥189.00
office旗舰店
售后无忧
立即购买>

CorelDRAW X8 简体中文【标准版 + Win】

￥1788.00
office旗舰店

正版软件

索尼将继续在中国市场推出新款手机，或许会搭载骁龙8 Gen3处理器

索尼公司已就有关其手机业务可能撤出中国大陆市场的传言做出了官方回应。索尼中国表示，旗下多项业务在中国稳健运营，包括手机业务在内。公司重申中国是其最重要的海外市场之一，对未来在中国的发展充满信心和期待。从目前的国内销售情况来看，索尼手机仍然保持着在市场上的活跃度，包括前XperiaPRO-I、Xperia5III、Xperia1V、Xperia5V以及Xperia1IV等多款机型均处于正常销售状态。虽然近年来索尼手机在中国市场的影响力有所减弱，但其在华发展历史并不算短，自2013年推出XperiaZ1起，索

7分钟前索尼 0
正版软件

2025年或许会有华为手机搭载自研超声波指纹识别技术

随着智能手机普遍采用全面屏设计，屏下指纹解锁技术已经成为安卓手机的一项标准功能。日前，著名数码博主“定焦数码”在社交媒体上分享了华为最新的超声波指纹识别专利，并表示：“在面对专利壁垒和购买限制时，华为选择了自主创新的道路。”据了解，目前国内许多手机厂商选择了供应链公司汇顶科技的超声波指纹识别技术。然而，受到高通专利壁垒的影响，华为面临无法使用该技术的困境。这一情况迫使华为开始着手自主研发相关技术。尽管华为已经取得这一重要的专利突破，但可能还需要时间才能将其应用于即将发布的Mate70系列。预计如果研发进展

22分钟前华为 0
正版软件

小鹏汽车创新满足市场需求，准备竞争对手挑战

在全国两会期间，小鹏汽车董事长兼CEO何小鹏分享了他对电动汽车行业未来走向的深刻见解。何小鹏指出，中国的新能源汽车市场已经迈入一个全新的竞争阶段——淘汰赛。在这一阶段，随着技术的不断革新和产品的日益成熟，企业在用户心中的认可度也在稳步上升。然而，这种认可度的提升并未使竞争变得缓和，相反，市场的竞争态势正在不断激化，优秀的企业正在通过不断的自我优化和提升，占据更大的市场份额，市场的集中度因此也在持续提高。据小编了解，何小鹏对于这场淘汰赛的态度非常明确。他认为，面对激烈的市场竞争，企业只有不断进行科技创新，不

37分钟前小鹏汽车 0
正版软件

仁宝最新平板Rover Play发布：创新游戏控制器，重新定义平板体验

台湾知名电脑厂商仁宝最近在iF设计奖官网上发布了一款别具特色的平板新品——RoverPlay。与市面上主打游戏功能的手机和平板电脑不同，RoverPlay在设计上展现出独特的创新。其最大亮点在于平板背面配备了一套专门的游戏控制器，为玩家带来了全新的操作体验。据小编了解，这套独特的游戏控制器被命名为“FlexiRear”，在平板未使用时，控制器巧妙地隐藏在背面，与平板表面保持齐平，不影响整体美观。当玩家需要使用时，只需通过简单的滑动和折叠动作，即可将控制器展开。仁宝官方表示，FlexiRear的设计充分考虑

52分钟前仁宝 0
正版软件

FF91汽车首次召回：法拉第未来安全气囊故障问题补救

据外媒TechCrunch报道，贾跃亭旗下的电动汽车初创公司法拉第未来最近宣布了一项首次召回计划。该召回计划涉及去年生产的所有11辆FF91汽车。根据美国国家公路交通安全管理局(NHTSA)的记录，法拉第未来公司宣布了一项召回计划，主要是因为FF91汽车的安全气囊警告灯出现故障。当车辆的安全气囊存在问题时，由于软件系统中的一个错误，警告灯可能无法正确显示，可能会对驾驶员的安全构成潜在威胁。为了解决这一问题，法拉第未来计划安排专门人员上门取车，对召回车辆进行全面检修，并在修复问题后重新交付给车主。据报道称，

1小时前 10:45 法拉第未来 0