真实项目里的 AI 编程

我拿编程 Agent 做真实项目,也把踩过的坑写下来。

这里记录我用 Codex、Claude Code、Cursor 和新模型做 AI 编程的实测:哪些 workflow 值得留,哪些坑不用再踩。

从这里开始

查看全部文章

新笔记

最近写的文章

挑一个方向

按主题翻文章

我最近在折腾

我主要测试哪些工具和工作流?

AI 编程

我在 Codex、Claude Code 和 Cursor 里反复用过的配置和 workflow。能复现的,我会把步骤写全。

编程 Agent

在大型项目里,我会用 MCP 和 skill 管好 context,也会让多个 Agent 协作。出现失控时,我会把过程和收拾办法写下来。

大模型评测

我会拿 Claude、GPT、Kimi、GLM、Gemini 和 Grok 跑自己熟悉的代码任务。我会写清结果和成本,也会标出自己接手的地方。

我怎么测

每篇笔记背后的测试步骤是什么?

每篇指南都走同一个循环,方便你在自己的代码库里复现。

  1. 从我正在交付的真实项目里挑一个任务,而不是玩具 demo。
  2. 把工具完整跑一遍,记录用到的命令、配置和模型。
  3. 用测试、人工复查和官方文档来核对输出。
  4. 记下成本、失败方式,以及我不得不接手的那一刻。
  5. 把 workflow 写清楚,方便你在自己的代码库里复现。

你能得到什么

你能从每一类内容中得到什么?

每篇文章都基于真实使用。下面是每一类给你什么,以及我如何验证。

hqman.me 上的内容类型,以及各自的验证方式。
内容类型你能得到什么我如何验证
AI 编程 workflow可复用的配置和完整命令在真实项目上跑,再用测试核对
编程 Agent 笔记上下文管理和复查方法在真实的多 Agent 运行里记录
大模型评测输出、成本和我踩到的限制在我熟悉的代码上跑同一个任务

命名来源

我是如何对照官方文档核对说法的?

当我描述一个工具是做什么的,我会对照官方文档核对,并链接来源。

"Codex is OpenAI's coding agent for software development."

来源:OpenAI, Codex documentation

"Claude Code is an agentic coding tool that reads your codebase, edits files, runs commands, and integrates with your development tools."

来源:Anthropic, Claude Code documentation

"Cursor is a coding agent for building ambitious software."

来源:Cursor, documentation

常见问题

常见问题与解答

AI Kai 主要关注什么内容?

AI Kai 是 Kai Wang 的技术实测站点,专注实用的 AI 编程工作流、编程 Agent(Codex、Claude Code、Cursor)以及大模型评测,提供可复现的完整配置。

这些编程 Agent 工作流是如何测试的?

每篇指南都在正在交付的真实项目里完整跑通,并通过单元测试、人工代码复查和官方文档核对,记录真实成本与失败边界。

我如何在自己的代码库中复现这些配置?

每篇文章都包含完整命令、配置文件、Prompt 架构(如 AGENTS.md)与排错要点,方便你直接在自己的项目中落地。

补充一点背景

谁是 AI Kai 背后的作者?

我在做 AI 产品,也把编程 Agent 用在日常开发里。这里的大多数文章,都来自我自己的电脑或线上项目里遇到的问题。我会把步骤和数据写清楚,方便你自己验证。