省 token 省到任务失败、重跑一遍,前面省的全赔进去。拆解 Claude Code 一个任务的四个成本变量:回合数、缓存、输出与思考、模型;讲清 effort 怎么调、何时降级或升到 Fable 5.1、别打断缓存、/compact 何时回本,以及用 /usage 量出你自己的数。
博客
个人原创博客日志
跟用 AI 写 Web 不一样,写 iOS App 中间隔着 Xcode、模拟器和签名机制。这篇讲第一次用 Claude Code 做 App 该怎么开局:项目用 Xcode 建、把编译和截图命令交给它形成自我验证闭环、CLAUDE.md 只写三样、一次只做一屏,以及几个一定会踩的坑。
ChatGPT 6 Astra 出来之后,Codex 配 Computer Use 已经能接下大部分靠浏览器点点点的运营活。这篇拆一遍我自己在跑的 X 热门推文采集流程:定时唤醒、读完整 AX 状态、结构化筛选、全局去重落库、导出 Markdown,最后推到邮件或 IM。
大模型接口是无状态的,每按一次回车,整段历史都会被重新打包发一遍,钱主要烧在这里。整理了我平常在用的省 token 手段:一个任务一个对话、让它精确读文件、大范围检索交给子 agent、砍掉常驻的 MCP 和 CLAUDE.md、简单活切便宜模型、管住输出长度。
用 ChatGPT 6 Astra 写了个机会研究工具:把有收入的软件业务收进来,让模型拆出客户为什么付费、哪些功能能砍、最小 MVP 长什么样。附完整技术栈、CSV/HTML/URL 三种数据入口,以及 Zod 结构化输出和 Prisma 事务写入的实现细节。
9 月 3 日 Anthropic 发 Claude Fable 5.1,9 月 4 日 OpenAI 发 GPT-6 Astra,输入输出定价一模一样。一个赌 Computer Use 铺宽度,一个赌长任务打深度。拆解两条路线、两种降本思路、两边各自的代价,以及独立开发者该怎么配。
一台 Mac、一个跑在本机的 Qwen3.8-27B、一句话提示词,79 分钟做出 737 行能玩、有音效的 RPG 俄罗斯方块。不联网、不花钱。附选题策略、模型自己写测试的全过程、三个必踩的坑和 llama.cpp 配置速查。
贴给 AI 的日志里常常带着 .env 的值。这篇讲三步固定动作——只留能定位问题的最小集、把值换成占位符、贴前搜一遍,并附一个剪贴板一键脱敏的 zsh 函数:为什么只按 sk_live_、AKIA 这类前缀特征匹配,会让一串 32 位十六进制的密钥整行漏出去。
Qwen3.8-27B 本地部署新手指南:llama.cpp router + pi 在 M4 Pro 上从下模型到跑通 agent,实测 11.4 tok/s。四个真踩进去的坑,以及当模型每秒只吐 11 个 token 时,prompt 该怎么写才能一次成型。
怀旧重玩宝可梦,查攻略太麻烦,于是用 Next.js + AI SDK + PokeAPI 做了个能用任何语言提问的攻略助手。这篇是从空目录到上线的完整过程:工具调用怎么写、一次提问为什么会打出十几次请求、怎么教它承认自己不知道。