首页
看点啥
插画图片
首页 科技看点 从一句需求到 App Store 送审:AI Agent 千步自主开发实录

从一句需求到 App Store 送审:AI Agent 千步自主开发实录

2026-09-30 0

让 AI 写出几段代码并不稀奇,真正困难的是把模糊需求一路推进到可交付状态。一次 Mac 应用实验把这条链路延伸到了市场调研、编码、自测、打包和 App Store 提审,同时也暴露出浏览器自动化失控与任务边界不清带来的巨大消耗。下面从完整执行记录出发,分析哪些环节已经可以交给 Agent,哪些仍需人工设防。

一句话需求到 App Store 提审:AI Agent 一夜跑了 960 步,我只发了 8 条消息

先说结论

  1. **Agent 已经能独立走完"立项 → 编码 → 打包 → 上传 → 送审"的全链路。**不是演示,是真实产物:一个叫 KinetZen 的 Mac 菜单栏 app,提交进 Apple 审核队列(WAITING_FOR_REVIEW),代码 1034 行 Swift,在 Apple 那边排队等审。
  2. 我给的全部输入是一句话:"做一个创意 Macos app,你自己分析 App Store 榜单,以 Kinet 开头命名,新建目录,做到 App Store 上架。"之后一整晚,人类只发了 8 条消息——其中 5 条是纠偏,3 条是"继续"。
  3. :962 步工具调用,125M tokens,成本 $8.82,墙钟 9 小时(人睡觉的时间)。同样的事外包一个 iOS 工程师,报价按周算。
  4. 也有翻车:两轮各烧掉 500+ 步、4 美元——一次是浏览器自动化死循环,一次是我以为它做完了其实没做完。失败的 token 占了全程 2/3,这两轮恰恰是最值得复盘的。

Agent 自主做了什么(按时间线)

第一轮:22:22,一句话之后,Agent 干了 518 步(4.19 美元)

我睡觉,它把 892KB 的 pkg 传上 App Store Connect

凌晨,asc-watch 自动盯守 + 我早上两条消息后,build 关联、元数据、年龄分级、隐私问卷、5 类 ASC 隐藏缺项(那个只认 409 报错的清单)全部补完,提审进入 WAITING_FOR_REVIEW。从一句话到进入 Apple 审核队列,中间人类参与度约等于一个产品经理在开早会。

最后它被我骂了一句才想起 git

代码写完、送审完成,git 是干净的——文档全落盘却没 commit。我发了条"文档落盘了却不 commit?",它按逻辑分组拆了 3 个 commit 补齐,顺手把"菜单栏 app 高发拒因清单"(2.4.5iii 最小功能、截图必须含菜单栏运行态)也沉淀成了文档。

烧钱复盘:960 步里,2/3 的 token 花在了两个坑上

轮次步数花费发生了什么
开发+打包518$4.19有效:调研→编码→自修 segfault→打包,一条龙
iOS 版尝试331$4.23报废:几十次 mouse_click/keyboard_type 打不进 Safari 登录 iframe——键击全进了前台另一个 app 的窗口。Agent 第 70 次左右才发现("连续十几次点击输入都打不进去,先停手"),自己叫停并换了策略
收尾113$0.40有效:元数据核验、commit 拆分、runbook 沉淀

两个教训都值钱:

  1. **GUI 自动化是 Agent 的成本黑洞。**同为 automation,shell 370 步干成了整个 app,浏览器键击 200+ 步连个登录框都进不去。能走 API 的绝不开浏览器,这条现在刻在我的工具集里。
  2. **"没做完"比"做错了"更贵。**iOS 那轮的 4 美元不是技术失败,是任务边界没划清——我上一句还在说 Mac app,下一句突然要 iOS 版,Agent 没有先确认平台差异就硬冲。任务切换时,一句"这是新任务,先列计划"值 4 美元。

为什么是"960 步"而不是"21 轮"

上一篇(21 轮交付一个功能)发出去,最多的问题是"这算自主吗,不是你在带它走?"这篇把尺度拉满:单轮内 518 步连续工具调用,中途零人类输入。轮是人的,步是它自己的——评价 Agent 自主度的单位从来不是对话轮数,是两次人类介入之间的步数。

给开发者的三条可复用结论

  1. 一句话需求是可行的,前提是 Agent 有"自己找验收标准"的能力。"做一个创意 app"这种指令能跑通,是因为它自己拆出了"查榜单→找空位→立项→上架"的验收链;没有这层能力的一句话需求,得到的只会是一份空想 PRD。
  2. **失败轮的 token 占比是 Agent 成熟度的最好的指标。**960 步里 2/3 花在两个坑上,说明这套系统的下一版优先级很清楚:堵死 GUI 自动化,管住任务边界——比再优化 10% 的编码效率值钱得多。
  3. 提审是分水岭。"AI 写了个 app"满地都是,"AI 写的 app 进了 Apple 审核队列"要求它同时搞定代码签名、App Store Connect 的 409 缺项、隐私问卷、四语截图——工程链路的最后一公里才是 Agent 的真实水平。

这套东西在哪跑

上述全流程发生在 KinetAios(GitHub: phinn/KinetAios,GPLv3):本地优先的多引擎 AI Agent 桌面端,Windows / macOS 双端,自带长期记忆、962 步审计日志(每一步的工具/耗时/token 都可回放)、BYO-Key 不抽成。本文成本数据直接取自它的 token 审计面板。


下一篇预告:长期记忆系统的踩坑实录——为什么向量检索不是记忆的全部。

喜欢(0)

上一篇

Jev 入门:从结构化决策到 Python 实战

Jev 入门:从结构化决策到 Python 实战

下一篇

Memory Provider 架构实战:拆解 Hermes、Mem0、Honcho 与 Hindsight 的共同设计

Memory Provider 架构实战:拆解 Hermes、Mem0、Honcho 与 Hindsight 的共同设计
猜你喜欢