<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>AI编程 on Yanmu</title>
        <link>https://AkuamT.github.io/tags/ai%E7%BC%96%E7%A8%8B/</link>
        <description>Recent content in AI编程 on Yanmu</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Fri, 20 Mar 2026 02:00:15 +0800</lastBuildDate><atom:link href="https://AkuamT.github.io/tags/ai%E7%BC%96%E7%A8%8B/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>AI编程进化史</title>
            <link>https://AkuamT.github.io/p/ai%E7%BC%96%E7%A8%8B%E8%BF%9B%E5%8C%96%E5%8F%B2/</link>
            <pubDate>Fri, 20 Mar 2026 02:00:15 +0800</pubDate>
            <guid>https://AkuamT.github.io/p/ai%E7%BC%96%E7%A8%8B%E8%BF%9B%E5%8C%96%E5%8F%B2/</guid>
            <description>&lt;img src=&#34;https://AkuamT.github.io/p/ai%E7%BC%96%E7%A8%8B%E8%BF%9B%E5%8C%96%E5%8F%B2/cover.svg&#34; alt=&#34;Featured image of post AI编程进化史&#34; /&gt;&lt;h1 id=&#34;-ai-编程进化史从提示词上下文工程到-harness&#34;&gt;🤖 AI 编程进化史：从提示词、上下文工程到 Harness&#xA;&lt;/h1&gt;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;同等能力的模型越来越多，各家产品的体验差距反而越拉越大。&#xA;有的产品写出来的代码可以直接提交上线，有的产品写出来的却难以维护——为什么？&#xA;&lt;strong&gt;因为模型是一样的，差距在于怎么用模型，怎么稳定地用模型。&lt;/strong&gt;&#xA;在 AI 行业里，这就叫 &lt;strong&gt;Harness Engineering（驾驭工程）&lt;/strong&gt;。&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;-harness-工程把-agent-拆成三层&#34;&gt;🧠 Harness 工程：把 Agent 拆成三层&#xA;&lt;/h2&gt;&lt;p&gt;我们将编程 Agent 划分为三个层次：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;Scaffolding（脚手架）&lt;/strong&gt;&#xA;负责 AI 任务执行前的所有准备工作，包括系统准备的工具。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;Harness（运行时编排，核心）&lt;/strong&gt;&#xA;整个智能体的核心调度中心。&#xA;负责管控 AI 的核心推理循环，协调工具调用、上下文管理、运行安全管控和会话数据的持久化存储。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;Context Engineering（上下文工程）&lt;/strong&gt;&#xA;负责管理大模型处理文本的最小计算单位——token 的资源分配。&#xA;决定 AI 运行过程中，哪些信息需要保留，哪些信息应当丢弃。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;&lt;strong&gt;一个稳定干活的 AI 代码智能体 = 所调用的一个或多个大模型 + 一套完善的 Harness 系统。&lt;/strong&gt;&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;-harness-很重要为什么现在才火&#34;&gt;⏳ Harness 很重要，为什么现在才火？&#xA;&lt;/h2&gt;&lt;h3 id=&#34;-第一阶段prompt-engineering提示词工程&#34;&gt;① 第一阶段：Prompt Engineering（提示词工程）&#xA;&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;核心关注点：怎么去写好一个指令。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;角色设定&lt;/strong&gt;：给 AI 划定明确的身份和职责边界&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;附上示例&lt;/strong&gt;：用 Few-shot 让 AI 照着格式和风格生成&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;思维链（Chain-of-Thought）&lt;/strong&gt;：在指令中要求 AI 一步一步拆解问题，逐步推导，减少跳跃式错误&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;h3 id=&#34;-第二阶段context-engineering上下文工程&#34;&gt;② 第二阶段：Context Engineering（上下文工程）&#xA;&lt;/h3&gt;&lt;p&gt;单条 prompt 已经不够用了——需要为模型&lt;strong&gt;动态构建整个上下文环境&lt;/strong&gt;。&#xA;让模型在做每一个决策时，都能精确看到它所需要的全部信息：任务文件、历史对话、工具规则、知识库条目……&lt;/p&gt;&#xA;&lt;p&gt;核心理念：&lt;strong&gt;给模型看它该看的，挡住它不该看的。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;-第三阶段harness-engineering驾驭工程&#34;&gt;③ 第三阶段：Harness Engineering（驾驭工程）&#xA;&lt;/h3&gt;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;每当你发现 Agent 犯了一个错误，你就花时间去工程化地解决它，让它不会犯相同的错误。&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;p&gt;模型的能力够了，但它就是不听话，怎么办？&#xA;&lt;strong&gt;答案就是——Harness Engineering。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;真实案例：&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;实验&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;条件&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;结果&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;LangChain&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;同一模型，仅优化 Harness&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Terminal Bench 2.0：&lt;strong&gt;52.8 → 66.5&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;Nate B Jones&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;同一模型、同一提示词，仅改变运行环境&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;编程基准测试率：&lt;strong&gt;42% → 78%&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;OpenAI&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;空 git 仓库起步，五个月，全 AI Agent 驱动&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;产出 &lt;strong&gt;~100 万行代码&lt;/strong&gt;，&lt;strong&gt;1500 个 PR&lt;/strong&gt;，人类零介入&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;&lt;strong&gt;Agent 不难，Harness 才难。&lt;/strong&gt;&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;-ai-任务为何频频失败&#34;&gt;💥 AI 任务为何频频失败？&#xA;&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;1. 试图一步到位&lt;/strong&gt;&#xA;在一个窗口里想把所有功能都做完，结果就是上下文窗口迅速耗尽，后半段的质量断崖式下跌。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;2. 过早宣布胜利&lt;/strong&gt;&#xA;复杂项目开发后期，AI 智能体完成了核心功能、有了可见产出，就直接判定任务完成而主动终止——哪怕大量功能还没实现，核心需求尚未满足，依然会停止。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;3. 过早标记功能完成&lt;/strong&gt;&#xA;AI 智能体只要写完了某个功能，就会将其标记为已完成。它不会主动做端到端的完整功能测试，也不会验证这个功能在真实环境中到底能不能用。&lt;strong&gt;看起来能跑，实际上到处是隐藏的 bug。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;4. 机械复制代码模式&lt;/strong&gt;&#xA;AI 会机械地沿用已有的代码模式（架构风格、编写规范），哪怕这个模式是错误的，并在整个项目里持续放大。不加约束的 AI 智能体，会以极快的速度在项目中积累&lt;strong&gt;大量技术债务&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;-harness-的四大护栏&#34;&gt;🛡️ Harness 的四大护栏&#xA;&lt;/h2&gt;&lt;h3 id=&#34;-1-上下文工程&#34;&gt;🔹 1. 上下文工程&#xA;&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;AGENTS.MD&lt;/strong&gt; 文件越长、信息越冗余，Agent 任务成功率就越低，推理成本却越高。&#xA;AGENTS.MD 文件应严格控制在 &lt;strong&gt;60 行以内&lt;/strong&gt;。&lt;/p&gt;&#xA;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;上下文是稀缺资源，过多的指导会挤掉真正重要的任务代码。&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;h3 id=&#34;-2-架构约束最核心&#34;&gt;🔹 2. 架构约束（最核心）&#xA;&lt;/h3&gt;&lt;p&gt;实行&lt;strong&gt;严格的分层架构&lt;/strong&gt;——不是用 prompt 告诉 agent&amp;quot;请遵守架构&amp;quot;，而是用&lt;strong&gt;确定性的 Linter 和结构化测试&lt;/strong&gt;来机械执行。&lt;/p&gt;&#xA;&lt;p&gt;在 Linter 报错信息里直接嵌入修复指引，告诉 agent 应该怎么改。&lt;strong&gt;约束比指令更有效。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h3 id=&#34;-3-feedback-loop反馈循环&#34;&gt;🔹 3. Feedback Loop（反馈循环）&#xA;&lt;/h3&gt;&lt;p&gt;在 Harness 里，代码审查变成 &lt;strong&gt;Agent 对 Agent&lt;/strong&gt; 的方式。&#xA;形成标准化闭环：&lt;strong&gt;规划与发现 → 构建 → 验证 → 修复&lt;/strong&gt;，循环往复，持续提纯代码质量。&lt;/p&gt;&#xA;&lt;h3 id=&#34;-4-熵管理&#34;&gt;🔹 4. 熵管理&#xA;&lt;/h3&gt;&lt;p&gt;随着时间推移，AI 生成代码会积累大量问题：文档过时、架构漂移、风格走样、死代码堆积……&#xA;让 &lt;strong&gt;Agent 为 Agent 维护文档&lt;/strong&gt;，持续对抗熵增，防止项目腐化。&lt;/p&gt;&#xA;&lt;hr&gt;&#xA;&lt;h2 id=&#34;-总结&#34;&gt;🧭 总结&#xA;&lt;/h2&gt;&lt;p&gt;AI 编程的进化，本质上是一场&lt;strong&gt;从&amp;quot;写好提示词&amp;quot;到&amp;quot;构建好系统&amp;quot;的范式转移&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;Prompt Engineering&lt;/strong&gt; 解决的是&amp;quot;怎么说&amp;quot;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Context Engineering&lt;/strong&gt; 解决的是&amp;quot;给什么信息&amp;quot;&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Harness Engineering&lt;/strong&gt; 解决的是&amp;quot;怎么管住它&amp;quot;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;三条线不是替代关系，而是&lt;strong&gt;叠加递进&lt;/strong&gt;——每一层都建立在上一层的基础之上。真正能稳定产出高质量代码的 AI 编程产品，必定在这三个层次上都下了硬功夫。&lt;/p&gt;&#xA;</description>
        </item></channel>
</rss>
