Claude Code 创业公司指南
Anthropic 访谈十多家 AI 原生创业公司后总结出的五条规则:人人都能发版、把繁琐自动化、信任但要验证、为「重建」而构建、原型—内部试用—产品化。
原文:The Claude Code guide for startups · Anthropic,2026-08-20
在前沿工作的 AI 原生公司
想窥见未来的工作方式,就去问问创业公司今天是怎么运作的。我们就这么做了。
我们和十几家高速成长的创业公司聊了聊,了解它们如何用智能体编码(agentic coding)工具打造产品、扩张公司。这些公司正在改写规则:谁有资格构建、什么该被丢弃、以及如何在「怎么造」和「造什么」之间形成飞轮。
而它们的交付速度,堪比规模十倍于自己的组织。
ClickHouse 交付的功能数量 +30%
Omni 工程效率 2–3 倍
Clay 100% 的 bug 分诊已自动化
Artemis Security 每周 6,000+ 个 PR
在这份指南里,我们将深入这些组织各具特色的落地实践,看看它们遵循哪些规则来实现快速交付并保持竞争优势。
在这个过程中,我们也会逐渐得到一个问题的答案:如果一个组织从零开始、围绕 Claude Code 来搭建自己的产品开发生命周期,会是什么样子?
提示: 只想看能落地的下一步?我们在指南末尾放了一份检查清单,汇总了每一章的关键技术要点。
01
人人都能发版
智能体编码降低了准入门槛,于是真正理解问题的那个人,可以亲手交付第一版修复。
智能体编码降低了非技术员工构建产品的门槛。有了 Claude Code,你不必精通某门编程语言、也不必会用 IDE,就能做出可用的功能。
对创业公司创始人来说,这个优势显而易见。首先,他们没有大公司那样的人头预算,所以必须「全员上阵」。但创始人看中的不只是原始产能——这些非技术成员同时带来了领域专业知识。
Heidi 的联合创始人兼 CEO Thomas Kelly 博士也表达了同样的看法。

「对我们来说,Claude Code 解决了『传话游戏』的问题。过去一个新想法在团队里的传递路径是:有想法的人告诉产品经理,产品经理告诉设计师,设计师再告诉工程师……而想法的精髓在这条链路上不可避免地被磨损掉。等到东西真正上线,往往已经和最初设想的不一样了。而且要花上好几周。Claude Code 把这条链路压缩掉了。真正理解问题的那个人可以直接提交一个 PR,只在真正需要设计师和工程师专业判断的环节把他们拉进来。」 Thomas Kelly 博士 · 联合创始人兼 CEO,Heidi
「人人都能发版」写成 LinkedIn 帖子很漂亮,但现实中到底怎么运作?市场团队去审批 pull request 吗?法务团队要去研究怎么二分定位不稳定测试(flaky test)吗?
我们得到的答案是:分工依然存在。市场的人还是做市场,开发的人还是做开发。但那个至关重要的第一步——把一个想法变成能跑起来的原型,从 0 到 1——对所有人开放。
我们还发现,最高效的创业公司会主动建立机制,让这类贡献成为系统性的常态,而不是听凭偶然或个人主动性。
打通连接
让员工「应该用 AI」是一回事,真正把 Claude Code 和他们需要的工具交到手上是另一回事。
在 Crosby,团队不是把律师拉到 Claude Code 面前,而是把 Claude Code 送到律师面前——把它接入律师们熟悉、每天都在用的工具和操作系统。
提示: Claude 无法理解它看不见的东西。放大 Claude 价值最有效的方式之一,就是把它连接到事实来源(sources of truth)和团队每天使用的工具上。
MCP 是一个 AI 工具集成的开源标准,能让 Claude Code 访问你的工具、数据库和 API。每当你的团队发现自己在从某个工具里复制粘贴信息到 Claude,就该考虑加上这类连接。
如果已经存在成熟的命令行工具(gh、kubectl、bq、psql),而你希望 Claude 面对的是和工程师同一份事实依据,那么通过 CLI 连接会更省 token。

Claude Code 桌面端的 MCP 连接器目录。
站会展示
想法总要有机会进入优先级排序,才能调动组织资源把它推向市场。对产品经理来说这条路是清晰的——毕竟这是他们的本职工作——但对非技术员工就没那么清晰了。
Clay 设立了季度评审,原型在会上被讨论、并有机会进入正式路线图。Clay 的一位 GTM(市场进入)团队成员就是这样做出了一个自主智能体:它会访问你的网站、填写你的线索收集表单、计时响应速度、给体验打分,并生成一份表现报告。
Omni 有一个专门的 Slack 频道用于展示 Claude 生成的原型,所有人都在里面贡献,包括资深技术人员。他们还实践着「人人都能发版」的推论——「人人都要和客户对话」。
共享 skills
「人人都能发版」和「东拼西凑」之间只有一线之隔。不管功能原型出自谁手,最终都要被整合进一个浑然一体的产品里。这时 skills 就派上用场了——它们是可复用的指令文件,把团队的标准和上下文编码其中,能确保开发在日益民主化的过程中依然保持一致。
「团队里任何人都可以用 Claude Code、以我们的设计系统为参照,起草产品组件、营销素材或演示材料。凡是会触及产品本身的 AI 产出,都必须跨过高得多的门槛,而 Claude Code 帮我们更精确地做到这一点。」Heidi 的 Thomas Kelly 博士说。
Skills 还能让新开发者和非技术员工快速上手、迅速进入状态。
提示: Skills 可以通过目录在全公司共享,这样一位员工的最佳实践可以瞬间传递给另一位。在仓库的每个子目录里放 CLAUDE.md 文件,用于记录该子目录专属、每次都适用的编码约定。而 skills 则用于按需触发的流程化工作流。更多信息请阅读:引导 Claude Code:何时用 CLAUDE.md、skills、hooks 和子智能体。
02
把繁琐自动化
智能体承担生命周期中机械的那 80%,工程师则把时间花在真正需要判断力的场景上。
自工业革命以来,所有公司都在试图通过技术获得效率,但这些创业公司拉开差距的地方,在于采用的速度和深度。
这些创始人相信 AI 是他们使命中不可或缺的组成部分。许多人明确表示:智能体负责机械的那 80%,工程师则把时间花在真正需要判断力的场景上。
具体来说,我们看到 AI 在他们的 SDLC(软件开发生命周期)各阶段中集成得比其他公司更紧密,也看到更多为端到端接管重复任务而专门打造的智能体。我们来看几个例子。
AI 原生的 SDLC
这些创业公司中有不少已经建立了机制,加速团队融入智能体编码流程。比如在 Emergent,Mukund 告诉我们:「入职第一天,新人只要把 Claude 指向正确的 markdown 文件,就能引导出整套开发环境。如果 Claude 在入职过程中撞到任何损坏或过时的内容,它会顺手更新那个文件。」
提示: Code Review(研究预览版)是 Claude Code 中的一项托管式多智能体服务。它会对你启用的仓库中的 PR 自动跑一遍评审。你可以手动修复发现的问题再推送,也可以在该问题下评论 @Claude 来闭环(前提是你已配置好 GitHub Actions)。

Code Review 会给每条发现标注严重级别。
这些工程师必须快速上手,因为这些团队交付得很快。
在这些组织里,Claude Code 不只帮忙生成代码,还负责评审。「我们基于自己审定过的技术与合规框架跑自动化代码评审,标出关键问题,并在任何东西上线前把建议的改动路由给对应的评审人。」Heidi 的 Kelly 博士说。
其中一些组织还为代码评审、测试和 CI 打造了定制智能体。相比单纯地部署代码,这些创业公司把相当多的注意力放在了构建循环(loops)上。
「我最喜欢的[智能体]是『Translucent 代码评审员』,它会在一次改动上扇出(fan out),从多个角度评审,然后像我们的资深工程师那样综合出结论——只是比任何单个人都快。」Translucent 创始人 Jack 说。
Clay「……做了一个智能体来处理 bug 分诊,从第一轮筛查一直到给出修复的代码改动建议。」Kareem 说。
提示: 过去几个月里,Claude Tag 一直是 Anthropic CI/CD 故障的一线值班响应者。近期每一起有事故报告的故障,第一份情况通报都是 Claude 写的,通常在 15 分钟内就发出了首份分析。
Claude Tag 有自己的服务账号,并能访问 Anthropic CI 工程师需要的工具,比如 Datadog 或 Grafana。常驻指令以 skills 的形式写在 markdown 文件里,提交到 GitHub 仓库中。这样多位同事可以共同迭代,我们也能像管理代码一样管理这些变更。

Claude Tag 在 Slack 里接手一个值班线程,并在频道内同步进展。

这一点在 ClickHouse 体现得最为极致。联合创始人兼 CTO Alexey Milovidov 表示,这家数据库公司几乎把 SDLC 的每个阶段都变成了自主循环。两个专门用于修复不稳定测试和发现测试覆盖缺口的智能体,如今已是 ClickHouse 仓库的第 2 和第 3 大贡献者。另有一族智能体负责运维,而团队本身就用 Claude Code 来构建和迭代这些智能体。
用智能体加速流程
另一个一致的模式是:这些创业公司不仅用 Claude Code 里的智能体循环加速开发,还专门造智能体来加速那些重复且往往枯燥的流程。
这些通常是例行工作,把它们自动化之后,注意力就能更多地投向竞争优势、客户关系和营收增长。我们看到最常被 Claude 加速的流程之一,是自助式数据分析。
这些公司几乎每一家都建立了某种机制,以便基于新鲜数据(包括非结构化数据)快速做决策——而快速决策正是创业公司生命中至关重要的转向能力的燃料。
举例来说,Clay 做了一个内部分析智能体;Heidi 用 Claude Code 把客户和临床医生的反馈与使用数据放在一起归类,从中提炼出对产品洞察真正有价值的信号。
ClickHouse 和 Omni 则把这类 AI 数据分析能力直接打包进了自己的产品里,全部由 Claude 驱动。
其他例子还包括:用子智能体总结数千份法律文书(Crosby)、扫描理赔数据以标记跨站点异常(Commure)、以及持续挖掘医院财务数据中分析师团队来不及捕捉的预警信号(Translucent)。
提示: 动态工作流(Dynamic workflows)可以把多个子智能体扇出,用于并行分析大量数据,或对另一个智能体的产出做对抗性评审。使用 Claude Opus 或 Claude Fable 这类模型时,直接说「扇出多个子智能体」或「用一个工作流」即可。

循环会不断重复工作周期,直到满足停止条件。
03
信任,但要验证
除非你有可靠的手段来监控和验证结果,否则就不该把一个流程自动化。
这条规则是规则 2「把繁琐自动化」的必要推论。除非你有可靠的手段来监控和验证结果,否则就不该把一个流程自动化。
提示: 把不可变的东西放进仓库根目录的 CLAUDE.md。Claude 在每个会话开始时都会读它,所以你的架构规则、安全边界和不可协商的底线会随每个会话一起生效。
需要说明的是,这些创业公司没有一家是让智能体直接合并到 main 分支然后听天由命的。它们中许多身处强监管行业,需要强有力的治理框架。Cainex 是一个特别有代表性的例子:把智能体和确定性校验结合起来,读取病历并生成用于指导医院计费的编码。
「这就是 Claude Code 为我们运行的循环。我们用一个智能体处理一批数据,我们的审核员在内部应用里评审产出。他们看到的不只是编码本身,还能看到模型的推理过程,并对两者都留下评论……所有内容都有版本、可审计。」他说。
「然后 Claude Code 接手。它直接从数据库里读取原始预测,连同每一条修正和评论一起读。每条修正都按涉及的编码类型打了标签,所以 Claude Code 知道自己面对的是诊断类问题、操作类问题还是别的类别,能直接定位到管辖该类编码的具体指引。
从那里出发,它找到智能体指令中导致错误的那一部分并加以修订;如果案例确实是全新的,就写一条新的指引。每次改动都基于一套有版本的指令进行,并在此前失败的那些病历上做测试。我们坚持的规则是:修原则,不修个例。」他继续说。
「接下来是回测。一份病历可以有不止一种可接受的编码方式,所以不能做字符串匹配。这个校验把针对我们已认可集合的语义匹配,和一个负责发问『这是真错误,还是另一条同样有效的路径?』的裁判结合起来,Claude Code 还会在此之上叠加自己的比对。
它会把候选改动跑遍一个黄金集(golden set)外加随机样本,在任何东西上线前把回归问题暴露出来。最后返回的是一份简短清单:建议的编辑、它无法定论的病历、以及它希望得到解答的问题。工程师的时间因此花在真正困难的案例上,而不是机械的那 80%。」他说。
从这个医疗计费的具体工作流中,创始人们可以提炼出许多通用的启示。
比如,Cainex 让领域专家定期评审和引导 Claude 的推理,并确保这些引导成为自我改进循环的一部分。但这些专家的作用不是一个个案例地去修,他们的引导被用作自我改进循环的输入。用 Uriah 的话说:「修原则,不修个例。」
提示: 循环(loops)是会不断重复工作周期、直到满足停止条件的智能体。用它们来跑更自主或更长周期的工作往往很有效。你可以用 skills 来定义智能体需要满足的判定标准(定义得越清晰越好),然后让智能体反复迭代直至达成目标。
举个例子,很多组织会做「不稳定测试智能体」或者说循环,因为它的停止条件清晰且自洽:智能体可以通过反复重跑测试直到通过,来自行验证修复是否成功。

循环会不断重复工作周期,直到满足停止条件。
另一个启示是:要用心维护一套强有力的评估「黄金集」,也就是团队用来验证智能体准确性的一组已核实的问答对。每家创业公司都应该为自己的关键用例维护多套评估集并定期更新,这样才能防止漂移,并有能力评估未来的新模型。
提示: 团队刚开始做智能体时,靠人工测试、内部试用(dogfooding)和直觉的组合,往往能走出惊人的距离。转折点通常出现在:用户反馈说改动之后智能体变差了,而团队却在「盲飞」——除了猜测和试错,没有任何验证手段。团队既分不清真实回归和噪声,也无法在上线前对数百个场景自动测试改动,更无法度量改进。更多信息请阅读:揭开 AI 智能体评估的神秘面纱。
Uriah 最后强调的一点是,这个过程需要打磨。「一开始并没有这么干净。我们的第一版过拟合了。它会通过把具体案例硬编码进去来『修复』问题,结果我们是在堆补丁,而不是变得更聪明。后来我们改了做法,强制归纳为通用原则,并对一次改动中能引入多少具体细节设了上限。」
提示: AI 智能体不是确定性的,但很多强监管场景要求流程每次都以完全相同的方式执行。Claude Code 提供了一些功能,可以把前沿智能与确定性流程结合起来。
Hooks 是用户自定义的命令,会在 Claude Code 生命周期的固定节点触发,可以充当硬性关卡。无论模型作何决定,它们每次都会执行。比如可以用来拦截未通过 lint 的写入、在提交前强制要求测试通过,或在任何内容离开沙箱前剥离密钥。
动态工作流以确定性的顺序编排子智能体,各自拥有独立的上下文窗口和聚焦的目标。/goal 适用于长而复杂的任务——在这类任务中,Claude 可能过早宣告完工、在自我评审时偏袒自己的结论、或逐渐偏离最初的目标。
04
为「重建」而构建
模型能力在这些团队脚下不断移动,所以几乎没有什么被当作永久之物。
许多 AI 原生创业公司处于持续自我重塑的状态。
AI 既是它们所构建之物的核心,也是它们构建方式的核心。由于模型能力在持续演进,突破性的功能和关键的脚手架一旦变成沉没成本,就会被立刻丢弃。许多组织把这种不断重建本身视作自己竞争优势的一部分。
「我们在 Clay 的做法是:你造一遍,然后再造一遍,再造一遍。等你造到第四遍,你已经知道了所有必要的东西,于是你把它做对了。所以我们不一定是把东西扔掉,我们只是重建它——而这一次带着更清晰的认知。」Kareem 说。
「一次重建不是在新路径上线时完成的,而是在旧路径被清除时才算完成。以前拆除工作在优先级之争中总是输:它枯燥,而且不产出任何功能。」Commure 联合创始人 Tanay 说,「现在 Commure 的工程师只需调用一个 Claude skill,大意是『对每一个已经全量发布的功能开关,开一个 PR 把它和相关代码一并删除』,然后工程师评审返回的结果。以前要吃掉大量开发周期的迁移工作,现在就是一份计划加一次扇出,几个小时就搞定了。」
提示: 用 git worktrees 在一份隔离的仓库副本里跑重建,当前版本则原封不动。Claude Code 可以帮你开一个——你会得到 v2 与 v1 并排运行,对两者跑同一套评估,只有新版本胜出时才合并。这正是「造四遍」变得廉价的原因。

一个仓库、一个对象存储——三份可同时工作的检出,各自处于自己的分支上。
每个链接的 worktree 都是一个普通目录,拥有自己检出的分支;三者共享 acme-web 内部那一份 .git 对象存储。
Kareem 还把 Clay 护城河的一部分描述为「持续重建、演进、并创造自我改进循环」的能力。
「我觉得当下任何一家公司的护城河,都在于它必须能自我改进。所以 Clay 是一台自我学习的营收引擎。你用得越多,我们就越了解谁是你最好的客户、你该说什么、什么奏效、什么没奏效——而这些还会随时间变化。」他说,「这场竞赛真正比的是谁能最快触达分发……这样你才能帮到每一个[客户],从而实现自我改进。」
在 2026 年 5 月的 Code with Claude 活动上,Harvey 的应用 AI 负责人 Niko Grupen 谈到,每一波新的模型能力浪潮——涌现式推理、智能体自动化、规划与编排——都要求平台做一次彻底的重新架构。
在同一场活动上,Cognition 联合创始人 Walden Yan 说:
「当下做 AI 的生存方式,就是接受你今天造出来的东西,很可能在半年到一年内被丢掉……[Devin] 用两年前那批模型是根本做不出来的,但我们的赌注是:这东西今天也许还不行,但很快就会行。」 Walden Yan · 联合创始人,Cognition
提示: 对于非琐碎的重写,用计划模式(plan mode)启动 Claude Code(--plan 或按 Shift+Tab)。Claude 会先探索代码库、提出重建方案,然后才写代码——你来批准或纠偏。这是拦住一次即将偏离架构的重建的最便宜的位置。
05
原型、内部试用、产品化
用 AI 来构建,帮助这些创业公司造出颠覆性的 AI 产品——这正是它们流程核心的飞轮。
许多创业公司的开发流程核心都有一个关键飞轮:用 AI 来构建,帮助它们造出颠覆性的 AI 产品。
当开发者在智能体编码实践上走得更深,他们对模型能力的把握就更牢,也更能洞察前沿的 harness(运行框架)设计正在如何演进。然后他们就能把这些灵感用到自己的智能体和产品里。
「我们从 [Anthropic 的] 文件方案 vs 向量嵌入方案中获得了启发,这让我们有底气在自己的产品里保持简单。我们避开了 RAG 流水线本会带来的大量复杂度。」Omni 的 Chris 说,「我们还看到 Claude Code 的 harness 是如何让用户并行做事的,于是把其中一些概念改造进了我们自己的 UI。」
这也帮助他们对自家产品的表现保持敏锐。
「因为我们的应用构建器背后也用 Anthropic 的模型,所以只要在产品上看到某个行为……我们就能在本地用 Claude Code 快速调试,判断它到底是模型行为还是 harness 的问题。这极大改善了我们的问题分诊周期。」Emergent 的 Mukund 说。
我们反复听到的模式是:用 Claude Code 造一个内部智能体,先在内部使用(dogfood),再根据反馈把它提升为面向客户的产品——通常借助 Claude API、SDK 或 Claude Managed Agents。
「我们在[产品里]构建了自己的 AI 智能体,供团队直接交互,包括 SQL 控制台里的智能体和一个 AI SRE。我们用 Claude Code 来构建和迭代这些智能体本身。也就是说,驱动客户 AI 体验的那套工具,本身有一部分就是用 AI 造出来的。」ClickHouse 的 Alexey 说。
检查清单
这份指南覆盖的内容不少。以下是汇总在一页里的关键要点:
第 1 章:人人都能发版
Claude 无法理解它看不见的东西。通过 MCP 或 CLI,把它连接到事实来源和团队每天使用的工具上。建一个公司插件市场,让一位员工的最佳实践可以借由 skill 瞬间传给另一位。在仓库的每个子目录里用 CLAUDE.md 记录该子目录专属、每次都适用的编码约定;skills 则用于按需触发的流程化工作流。
第 2 章:把繁琐自动化
在仓库上配好 Code Review(研究预览版),对 PR 自动跑一遍评审。把 Claude Tag(公测)接进你的 CI/CD 值班响应和 bug 分诊。动态工作流可以扇出多个子智能体并行分析大量数据,或对另一个智能体的产出做对抗性评审。
第 3 章:信任,但要验证
把不可变的东西放进仓库根目录的 CLAUDE.md。用循环(loops)——也就是不断重复工作周期直到满足停止条件的智能体——来跑更自主或更长周期的工作。建立一套创建和维护智能体评估集的流程。Hooks 是用户自定义命令,会在 Claude Code 生命周期的固定节点触发,可以充当硬性关卡——当工作中某些环节必须是确定性的,就用它。
第 4 章:为「重建」而构建
用 git worktrees 在一份隔离的仓库副本里跑重建,当前版本原封不动。这正是「造四遍」变得廉价的原因。对于非琐碎的重写,用计划模式(plan mode)启动 Claude Code(/plan 或按 Shift+Tab)。Claude 会先探索代码库、提出重建方案,然后才写代码——你来批准或纠偏。这是拦住一次即将偏离架构的重建的最便宜的位置。
站在前沿的创业公司,在前沿构建
这些洞见来自和你一样在前沿构建的同行,希望你觉得它们实用且可落地。Claude 创业者社区是灵感、最佳实践和建议的持续来源。你可以通过以下方式加入: