返回转载

Claude Code 创业公司指南

原作者 Anthropic约 18 分钟读完

Anthropic 访谈十多家 AI 原生创业公司后总结出的五条规则:人人都能发版、把繁琐自动化、信任但要验证、为「重建」而构建、原型—内部试用—产品化。


原文:The Claude Code guide for startups · Anthropic,2026-08-20

在前沿工作的 AI 原生公司

想窥见未来的工作方式,就去问问创业公司今天是怎么运作的。我们就这么做了。

我们和十几家高速成长的创业公司聊了聊,了解它们如何用智能体编码(agentic coding)工具打造产品、扩张公司。这些公司正在改写规则:谁有资格构建、什么该被丢弃、以及如何在「怎么造」和「造什么」之间形成飞轮。

而它们的交付速度,堪比规模十倍于自己的组织。

ClickHouse 交付的功能数量 +30%

Omni 工程效率 2–3 倍

Clay 100% 的 bug 分诊已自动化

Artemis Security 每周 6,000+ 个 PR

在这份指南里,我们将深入这些组织各具特色的落地实践,看看它们遵循哪些规则来实现快速交付并保持竞争优势。

在这个过程中,我们也会逐渐得到一个问题的答案:如果一个组织从零开始、围绕 Claude Code 来搭建自己的产品开发生命周期,会是什么样子?

提示: 只想看能落地的下一步?我们在指南末尾放了一份检查清单,汇总了每一章的关键技术要点。

01

人人都能发版

智能体编码降低了准入门槛,于是真正理解问题的那个人,可以亲手交付第一版修复。

智能体编码降低了非技术员工构建产品的门槛。有了 Claude Code,你不必精通某门编程语言、也不必会用 IDE,就能做出可用的功能。

对创业公司创始人来说,这个优势显而易见。首先,他们没有大公司那样的人头预算,所以必须「全员上阵」。但创始人看中的不只是原始产能——这些非技术成员同时带来了领域专业知识。

Heidi 的联合创始人兼 CEO Thomas Kelly 博士也表达了同样的看法。

Thomas Kelly 博士

「对我们来说,Claude Code 解决了『传话游戏』的问题。过去一个新想法在团队里的传递路径是:有想法的人告诉产品经理,产品经理告诉设计师,设计师再告诉工程师……而想法的精髓在这条链路上不可避免地被磨损掉。等到东西真正上线,往往已经和最初设想的不一样了。而且要花上好几周。Claude Code 把这条链路压缩掉了。真正理解问题的那个人可以直接提交一个 PR,只在真正需要设计师和工程师专业判断的环节把他们拉进来。」 Thomas Kelly 博士 · 联合创始人兼 CEO,Heidi

「人人都能发版」写成 LinkedIn 帖子很漂亮,但现实中到底怎么运作?市场团队去审批 pull request 吗?法务团队要去研究怎么二分定位不稳定测试(flaky test)吗?

我们得到的答案是:分工依然存在。市场的人还是做市场,开发的人还是做开发。但那个至关重要的第一步——把一个想法变成能跑起来的原型,从 0 到 1——对所有人开放。

我们还发现,最高效的创业公司会主动建立机制,让这类贡献成为系统性的常态,而不是听凭偶然或个人主动性。

打通连接

让员工「应该用 AI」是一回事,真正把 Claude Code 和他们需要的工具交到手上是另一回事。

在 Crosby,团队不是把律师拉到 Claude Code 面前,而是把 Claude Code 送到律师面前——把它接入律师们熟悉、每天都在用的工具和操作系统。

提示: Claude 无法理解它看不见的东西。放大 Claude 价值最有效的方式之一,就是把它连接到事实来源(sources of truth)和团队每天使用的工具上。

MCP 是一个 AI 工具集成的开源标准,能让 Claude Code 访问你的工具、数据库和 API。每当你的团队发现自己在从某个工具里复制粘贴信息到 Claude,就该考虑加上这类连接。

如果已经存在成熟的命令行工具(gh、kubectl、bq、psql),而你希望 Claude 面对的是和工程师同一份事实依据,那么通过 CLI 连接会更省 token。

Claude Code 桌面端的 MCP 连接器目录

Claude Code 桌面端的 MCP 连接器目录。

站会展示

想法总要有机会进入优先级排序,才能调动组织资源把它推向市场。对产品经理来说这条路是清晰的——毕竟这是他们的本职工作——但对非技术员工就没那么清晰了。

Clay 设立了季度评审,原型在会上被讨论、并有机会进入正式路线图。Clay 的一位 GTM(市场进入)团队成员就是这样做出了一个自主智能体:它会访问你的网站、填写你的线索收集表单、计时响应速度、给体验打分,并生成一份表现报告。

Omni 有一个专门的 Slack 频道用于展示 Claude 生成的原型,所有人都在里面贡献,包括资深技术人员。他们还实践着「人人都能发版」的推论——「人人都要和客户对话」。

共享 skills

「人人都能发版」和「东拼西凑」之间只有一线之隔。不管功能原型出自谁手,最终都要被整合进一个浑然一体的产品里。这时 skills 就派上用场了——它们是可复用的指令文件,把团队的标准和上下文编码其中,能确保开发在日益民主化的过程中依然保持一致。

「团队里任何人都可以用 Claude Code、以我们的设计系统为参照,起草产品组件、营销素材或演示材料。凡是会触及产品本身的 AI 产出,都必须跨过高得多的门槛,而 Claude Code 帮我们更精确地做到这一点。」Heidi 的 Thomas Kelly 博士说。

Skills 还能让新开发者和非技术员工快速上手、迅速进入状态。

提示: Skills 可以通过目录在全公司共享,这样一位员工的最佳实践可以瞬间传递给另一位。在仓库的每个子目录里放 CLAUDE.md 文件,用于记录该子目录专属、每次都适用的编码约定。而 skills 则用于按需触发的流程化工作流。更多信息请阅读:引导 Claude Code:何时用 CLAUDE.md、skills、hooks 和子智能体。

02

把繁琐自动化

智能体承担生命周期中机械的那 80%,工程师则把时间花在真正需要判断力的场景上。

自工业革命以来,所有公司都在试图通过技术获得效率,但这些创业公司拉开差距的地方,在于采用的速度和深度。

这些创始人相信 AI 是他们使命中不可或缺的组成部分。许多人明确表示:智能体负责机械的那 80%,工程师则把时间花在真正需要判断力的场景上。

具体来说,我们看到 AI 在他们的 SDLC(软件开发生命周期)各阶段中集成得比其他公司更紧密,也看到更多为端到端接管重复任务而专门打造的智能体。我们来看几个例子。

AI 原生的 SDLC

这些创业公司中有不少已经建立了机制,加速团队融入智能体编码流程。比如在 Emergent,Mukund 告诉我们:「入职第一天,新人只要把 Claude 指向正确的 markdown 文件,就能引导出整套开发环境。如果 Claude 在入职过程中撞到任何损坏或过时的内容,它会顺手更新那个文件。」

提示: Code Review(研究预览版)是 Claude Code 中的一项托管式多智能体服务。它会对你启用的仓库中的 PR 自动跑一遍评审。你可以手动修复发现的问题再推送,也可以在该问题下评论 @Claude 来闭环(前提是你已配置好 GitHub Actions)。

Code Review 给每条发现标注严重级别

Code Review 会给每条发现标注严重级别。

这些工程师必须快速上手,因为这些团队交付得很快。

在这些组织里,Claude Code 不只帮忙生成代码,还负责评审。「我们基于自己审定过的技术与合规框架跑自动化代码评审,标出关键问题,并在任何东西上线前把建议的改动路由给对应的评审人。」Heidi 的 Kelly 博士说。

其中一些组织还为代码评审、测试和 CI 打造了定制智能体。相比单纯地部署代码,这些创业公司把相当多的注意力放在了构建循环(loops)上。

「我最喜欢的[智能体]是『Translucent 代码评审员』,它会在一次改动上扇出(fan out),从多个角度评审,然后像我们的资深工程师那样综合出结论——只是比任何单个人都快。」Translucent 创始人 Jack 说。

Clay「……做了一个智能体来处理 bug 分诊,从第一轮筛查一直到给出修复的代码改动建议。」Kareem 说。

提示: 过去几个月里,Claude Tag 一直是 Anthropic CI/CD 故障的一线值班响应者。近期每一起有事故报告的故障,第一份情况通报都是 Claude 写的,通常在 15 分钟内就发出了首份分析。

Claude Tag 有自己的服务账号,并能访问 Anthropic CI 工程师需要的工具,比如 Datadog 或 Grafana。常驻指令以 skills 的形式写在 markdown 文件里,提交到 GitHub 仓库中。这样多位同事可以共同迭代,我们也能像管理代码一样管理这些变更。

Claude Tag 在 Slack 里接手值班线程

Claude Tag 在 Slack 里接手一个值班线程,并在频道内同步进展。

Alexey Milovidov

这一点在 ClickHouse 体现得最为极致。联合创始人兼 CTO Alexey Milovidov 表示,这家数据库公司几乎把 SDLC 的每个阶段都变成了自主循环。两个专门用于修复不稳定测试和发现测试覆盖缺口的智能体,如今已是 ClickHouse 仓库的第 2 和第 3 大贡献者。另有一族智能体负责运维,而团队本身就用 Claude Code 来构建和迭代这些智能体。

用智能体加速流程

另一个一致的模式是:这些创业公司不仅用 Claude Code 里的智能体循环加速开发,还专门造智能体来加速那些重复且往往枯燥的流程。

这些通常是例行工作,把它们自动化之后,注意力就能更多地投向竞争优势、客户关系和营收增长。我们看到最常被 Claude 加速的流程之一,是自助式数据分析。

这些公司几乎每一家都建立了某种机制,以便基于新鲜数据(包括非结构化数据)快速做决策——而快速决策正是创业公司生命中至关重要的转向能力的燃料。

举例来说,Clay 做了一个内部分析智能体;Heidi 用 Claude Code 把客户和临床医生的反馈与使用数据放在一起归类,从中提炼出对产品洞察真正有价值的信号。

ClickHouse 和 Omni 则把这类 AI 数据分析能力直接打包进了自己的产品里,全部由 Claude 驱动。

其他例子还包括:用子智能体总结数千份法律文书(Crosby)、扫描理赔数据以标记跨站点异常(Commure)、以及持续挖掘医院财务数据中分析师团队来不及捕捉的预警信号(Translucent)。

提示: 动态工作流(Dynamic workflows)可以把多个子智能体扇出,用于并行分析大量数据,或对另一个智能体的产出做对抗性评审。使用 Claude Opus 或 Claude Fable 这类模型时,直接说「扇出多个子智能体」或「用一个工作流」即可。

动态工作流扇出多个子智能体

循环会不断重复工作周期,直到满足停止条件。

03

信任,但要验证

除非你有可靠的手段来监控和验证结果,否则就不该把一个流程自动化。

这条规则是规则 2「把繁琐自动化」的必要推论。除非你有可靠的手段来监控和验证结果,否则就不该把一个流程自动化。

提示: 把不可变的东西放进仓库根目录的 CLAUDE.md。Claude 在每个会话开始时都会读它,所以你的架构规则、安全边界和不可协商的底线会随每个会话一起生效。

需要说明的是,这些创业公司没有一家是让智能体直接合并到 main 分支然后听天由命的。它们中许多身处强监管行业,需要强有力的治理框架。Cainex 是一个特别有代表性的例子:把智能体和确定性校验结合起来,读取病历并生成用于指导医院计费的编码。

「这就是 Claude Code 为我们运行的循环。我们用一个智能体处理一批数据,我们的审核员在内部应用里评审产出。他们看到的不只是编码本身,还能看到模型的推理过程,并对两者都留下评论……所有内容都有版本、可审计。」他说。

「然后 Claude Code 接手。它直接从数据库里读取原始预测,连同每一条修正和评论一起读。每条修正都按涉及的编码类型打了标签,所以 Claude Code 知道自己面对的是诊断类问题、操作类问题还是别的类别,能直接定位到管辖该类编码的具体指引。

从那里出发,它找到智能体指令中导致错误的那一部分并加以修订;如果案例确实是全新的,就写一条新的指引。每次改动都基于一套有版本的指令进行,并在此前失败的那些病历上做测试。我们坚持的规则是:修原则,不修个例。」他继续说。

「接下来是回测。一份病历可以有不止一种可接受的编码方式,所以不能做字符串匹配。这个校验把针对我们已认可集合的语义匹配,和一个负责发问『这是真错误,还是另一条同样有效的路径?』的裁判结合起来,Claude Code 还会在此之上叠加自己的比对。

它会把候选改动跑遍一个黄金集(golden set)外加随机样本,在任何东西上线前把回归问题暴露出来。最后返回的是一份简短清单:建议的编辑、它无法定论的病历、以及它希望得到解答的问题。工程师的时间因此花在真正困难的案例上,而不是机械的那 80%。」他说。

从这个医疗计费的具体工作流中,创始人们可以提炼出许多通用的启示。

比如,Cainex 让领域专家定期评审和引导 Claude 的推理,并确保这些引导成为自我改进循环的一部分。但这些专家的作用不是一个个案例地去修,他们的引导被用作自我改进循环的输入。用 Uriah 的话说:「修原则,不修个例。」

提示: 循环(loops)是会不断重复工作周期、直到满足停止条件的智能体。用它们来跑更自主或更长周期的工作往往很有效。你可以用 skills 来定义智能体需要满足的判定标准(定义得越清晰越好),然后让智能体反复迭代直至达成目标。

举个例子,很多组织会做「不稳定测试智能体」或者说循环,因为它的停止条件清晰且自洽:智能体可以通过反复重跑测试直到通过,来自行验证修复是否成功。

循环重复工作周期直到满足停止条件

循环会不断重复工作周期,直到满足停止条件。

另一个启示是:要用心维护一套强有力的评估「黄金集」,也就是团队用来验证智能体准确性的一组已核实的问答对。每家创业公司都应该为自己的关键用例维护多套评估集并定期更新,这样才能防止漂移,并有能力评估未来的新模型。

提示: 团队刚开始做智能体时,靠人工测试、内部试用(dogfooding)和直觉的组合,往往能走出惊人的距离。转折点通常出现在:用户反馈说改动之后智能体变差了,而团队却在「盲飞」——除了猜测和试错,没有任何验证手段。团队既分不清真实回归和噪声,也无法在上线前对数百个场景自动测试改动,更无法度量改进。更多信息请阅读:揭开 AI 智能体评估的神秘面纱。

Uriah 最后强调的一点是,这个过程需要打磨。「一开始并没有这么干净。我们的第一版过拟合了。它会通过把具体案例硬编码进去来『修复』问题,结果我们是在堆补丁,而不是变得更聪明。后来我们改了做法,强制归纳为通用原则,并对一次改动中能引入多少具体细节设了上限。」

提示: AI 智能体不是确定性的,但很多强监管场景要求流程每次都以完全相同的方式执行。Claude Code 提供了一些功能,可以把前沿智能与确定性流程结合起来。

Hooks 是用户自定义的命令,会在 Claude Code 生命周期的固定节点触发,可以充当硬性关卡。无论模型作何决定,它们每次都会执行。比如可以用来拦截未通过 lint 的写入、在提交前强制要求测试通过,或在任何内容离开沙箱前剥离密钥。

动态工作流以确定性的顺序编排子智能体,各自拥有独立的上下文窗口和聚焦的目标。/goal 适用于长而复杂的任务——在这类任务中,Claude 可能过早宣告完工、在自我评审时偏袒自己的结论、或逐渐偏离最初的目标。

04

为「重建」而构建

模型能力在这些团队脚下不断移动,所以几乎没有什么被当作永久之物。

许多 AI 原生创业公司处于持续自我重塑的状态。

AI 既是它们所构建之物的核心,也是它们构建方式的核心。由于模型能力在持续演进,突破性的功能和关键的脚手架一旦变成沉没成本,就会被立刻丢弃。许多组织把这种不断重建本身视作自己竞争优势的一部分。

「我们在 Clay 的做法是:你造一遍,然后再造一遍,再造一遍。等你造到第四遍,你已经知道了所有必要的东西,于是你把它做对了。所以我们不一定是把东西扔掉,我们只是重建它——而这一次带着更清晰的认知。」Kareem 说。

「一次重建不是在新路径上线时完成的,而是在旧路径被清除时才算完成。以前拆除工作在优先级之争中总是输:它枯燥,而且不产出任何功能。」Commure 联合创始人 Tanay 说,「现在 Commure 的工程师只需调用一个 Claude skill,大意是『对每一个已经全量发布的功能开关,开一个 PR 把它和相关代码一并删除』,然后工程师评审返回的结果。以前要吃掉大量开发周期的迁移工作,现在就是一份计划加一次扇出,几个小时就搞定了。」

提示: 用 git worktrees 在一份隔离的仓库副本里跑重建,当前版本则原封不动。Claude Code 可以帮你开一个——你会得到 v2 与 v1 并排运行,对两者跑同一套评估,只有新版本胜出时才合并。这正是「造四遍」变得廉价的原因。

git worktrees:一个仓库、三份并行检出

一个仓库、一个对象存储——三份可同时工作的检出,各自处于自己的分支上。

每个链接的 worktree 都是一个普通目录,拥有自己检出的分支;三者共享 acme-web 内部那一份 .git 对象存储。

Kareem 还把 Clay 护城河的一部分描述为「持续重建、演进、并创造自我改进循环」的能力。

「我觉得当下任何一家公司的护城河,都在于它必须能自我改进。所以 Clay 是一台自我学习的营收引擎。你用得越多,我们就越了解谁是你最好的客户、你该说什么、什么奏效、什么没奏效——而这些还会随时间变化。」他说,「这场竞赛真正比的是谁能最快触达分发……这样你才能帮到每一个[客户],从而实现自我改进。」

在 2026 年 5 月的 Code with Claude 活动上,Harvey 的应用 AI 负责人 Niko Grupen 谈到,每一波新的模型能力浪潮——涌现式推理、智能体自动化、规划与编排——都要求平台做一次彻底的重新架构。

在同一场活动上,Cognition 联合创始人 Walden Yan 说:

「当下做 AI 的生存方式,就是接受你今天造出来的东西,很可能在半年到一年内被丢掉……[Devin] 用两年前那批模型是根本做不出来的,但我们的赌注是:这东西今天也许还不行,但很快就会行。」 Walden Yan · 联合创始人,Cognition

提示: 对于非琐碎的重写,用计划模式(plan mode)启动 Claude Code(--plan 或按 Shift+Tab)。Claude 会先探索代码库、提出重建方案,然后才写代码——你来批准或纠偏。这是拦住一次即将偏离架构的重建的最便宜的位置。

05

原型、内部试用、产品化

用 AI 来构建,帮助这些创业公司造出颠覆性的 AI 产品——这正是它们流程核心的飞轮。

许多创业公司的开发流程核心都有一个关键飞轮:用 AI 来构建,帮助它们造出颠覆性的 AI 产品。

当开发者在智能体编码实践上走得更深,他们对模型能力的把握就更牢,也更能洞察前沿的 harness(运行框架)设计正在如何演进。然后他们就能把这些灵感用到自己的智能体和产品里。

「我们从 [Anthropic 的] 文件方案 vs 向量嵌入方案中获得了启发,这让我们有底气在自己的产品里保持简单。我们避开了 RAG 流水线本会带来的大量复杂度。」Omni 的 Chris 说,「我们还看到 Claude Code 的 harness 是如何让用户并行做事的,于是把其中一些概念改造进了我们自己的 UI。」

这也帮助他们对自家产品的表现保持敏锐。

「因为我们的应用构建器背后也用 Anthropic 的模型,所以只要在产品上看到某个行为……我们就能在本地用 Claude Code 快速调试,判断它到底是模型行为还是 harness 的问题。这极大改善了我们的问题分诊周期。」Emergent 的 Mukund 说。

我们反复听到的模式是:用 Claude Code 造一个内部智能体,先在内部使用(dogfood),再根据反馈把它提升为面向客户的产品——通常借助 Claude API、SDK 或 Claude Managed Agents。

「我们在[产品里]构建了自己的 AI 智能体,供团队直接交互,包括 SQL 控制台里的智能体和一个 AI SRE。我们用 Claude Code 来构建和迭代这些智能体本身。也就是说,驱动客户 AI 体验的那套工具,本身有一部分就是用 AI 造出来的。」ClickHouse 的 Alexey 说。

检查清单

这份指南覆盖的内容不少。以下是汇总在一页里的关键要点:

第 1 章:人人都能发版

Claude 无法理解它看不见的东西。通过 MCP 或 CLI,把它连接到事实来源和团队每天使用的工具上。建一个公司插件市场,让一位员工的最佳实践可以借由 skill 瞬间传给另一位。在仓库的每个子目录里用 CLAUDE.md 记录该子目录专属、每次都适用的编码约定;skills 则用于按需触发的流程化工作流。

第 2 章:把繁琐自动化

在仓库上配好 Code Review(研究预览版),对 PR 自动跑一遍评审。把 Claude Tag(公测)接进你的 CI/CD 值班响应和 bug 分诊。动态工作流可以扇出多个子智能体并行分析大量数据,或对另一个智能体的产出做对抗性评审。

第 3 章:信任,但要验证

把不可变的东西放进仓库根目录的 CLAUDE.md。用循环(loops)——也就是不断重复工作周期直到满足停止条件的智能体——来跑更自主或更长周期的工作。建立一套创建和维护智能体评估集的流程。Hooks 是用户自定义命令,会在 Claude Code 生命周期的固定节点触发,可以充当硬性关卡——当工作中某些环节必须是确定性的,就用它。

第 4 章:为「重建」而构建

用 git worktrees 在一份隔离的仓库副本里跑重建,当前版本原封不动。这正是「造四遍」变得廉价的原因。对于非琐碎的重写,用计划模式(plan mode)启动 Claude Code(/plan 或按 Shift+Tab)。Claude 会先探索代码库、提出重建方案,然后才写代码——你来批准或纠偏。这是拦住一次即将偏离架构的重建的最便宜的位置。

站在前沿的创业公司,在前沿构建

这些洞见来自和你一样在前沿构建的同行,希望你觉得它们实用且可落地。Claude 创业者社区是灵感、最佳实践和建议的持续来源。你可以通过以下方式加入: