省 token 省到任务失败、重跑一遍,前面省的全赔进去。拆解 Claude Code 一个任务的四个成本变量:回合数、缓存、输出与思考、模型;讲清 effort 怎么调、何时降级或升到 Fable 5.1、别打断缓存、/compact 何时回本,以及用 /usage 量出你自己的数。
老金的分享
欢迎来到老金的个人原创技术博客。这里主要写 Claude Code、Codex 等 AI 编程工具实战、Agent 与 Harness 工程、Skills 与上下文工程,以及 OpenClaw 等开源项目源码解读。每篇都来自我自己的一线实操,讲清楚怎么做、为什么、会踩哪些坑。
最新文章
跟用 AI 写 Web 不一样,写 iOS App 中间隔着 Xcode、模拟器和签名机制。这篇讲第一次用 Claude Code 做 App 该怎么开局:项目用 Xcode 建、把编译和截图命令交给它形成自我验证闭环、CLAUDE.md 只写三样、一次只做一屏,以及几个一定会踩的坑。
ChatGPT 6 Astra 出来之后,Codex 配 Computer Use 已经能接下大部分靠浏览器点点点的运营活。这篇拆一遍我自己在跑的 X 热门推文采集流程:定时唤醒、读完整 AX 状态、结构化筛选、全局去重落库、导出 Markdown,最后推到邮件或 IM。
大模型接口是无状态的,每按一次回车,整段历史都会被重新打包发一遍,钱主要烧在这里。整理了我平常在用的省 token 手段:一个任务一个对话、让它精确读文件、大范围检索交给子 agent、砍掉常驻的 MCP 和 CLAUDE.md、简单活切便宜模型、管住输出长度。
用 ChatGPT 6 Astra 写了个机会研究工具:把有收入的软件业务收进来,让模型拆出客户为什么付费、哪些功能能砍、最小 MVP 长什么样。附完整技术栈、CSV/HTML/URL 三种数据入口,以及 Zod 结构化输出和 Prisma 事务写入的实现细节。
9 月 3 日 Anthropic 发 Claude Fable 5.1,9 月 4 日 OpenAI 发 GPT-6 Astra,输入输出定价一模一样。一个赌 Computer Use 铺宽度,一个赌长任务打深度。拆解两条路线、两种降本思路、两边各自的代价,以及独立开发者该怎么配。
一台 Mac、一个跑在本机的 Qwen3.8-27B、一句话提示词,79 分钟做出 737 行能玩、有音效的 RPG 俄罗斯方块。不联网、不花钱。附选题策略、模型自己写测试的全过程、三个必踩的坑和 llama.cpp 配置速查。
贴给 AI 的日志里常常带着 .env 的值。这篇讲三步固定动作——只留能定位问题的最小集、把值换成占位符、贴前搜一遍,并附一个剪贴板一键脱敏的 zsh 函数:为什么只按 sk_live_、AKIA 这类前缀特征匹配,会让一串 32 位十六进制的密钥整行漏出去。
Anthropic 应用 AI 团队的内部实践:当代码不再是瓶颈,如何把规划、设计、构建、测试、部署、维护六个阶段逐一改造成 AI 原生流程,并让治理跟上智能体的节奏。
Qwen3.8-27B 本地部署新手指南:llama.cpp router + pi 在 M4 Pro 上从下模型到跑通 agent,实测 11.4 tok/s。四个真踩进去的坑,以及当模型每秒只吐 11 个 token 时,prompt 该怎么写才能一次成型。