Harness Engineering 指南· №8
Harness Engineering 前沿挑战(八):未解决的问题与未来方向
整理Harness Engineering领域七个未解决的核心问题:棕地项目改造、功能验证缺失、长期可维护性未知、Harness厚薄之争、单多Agent选择困惑、评测体系缺失、自适应Harness方向。附研究者可探索的四个方向。
- #AI 编程
👋 hi,这里是
随手记下关于代码、设计 与日常的一些小想法。
Journal
随笔、研究与作品 — 一个持续生长的写作实验室。
按标签筛选
Harness Engineering 指南· №8
整理Harness Engineering领域七个未解决的核心问题:棕地项目改造、功能验证缺失、长期可维护性未知、Harness厚薄之争、单多Agent选择困惑、评测体系缺失、自适应Harness方向。附研究者可探索的四个方向。
Harness Engineering 指南· №1
Harness Engineering是2026年AI Agent开发圈的高频词。本文解释核心定义:Agent = Model + Harness,模型之外的一切决定系统下限。包含Can.ac实验、40%上下文阈值、六层架构概览和工程师段位自测。
Harness Engineering 指南· №5
深度横评四大主流Harness框架:OpenClaw、Claude Code、OpenCode、Hermes Agent。从定位、架构、记忆系统、安全机制、适用场景等维度全面对比,附场景化选型指南。
Harness Engineering 指南· №3
详解生产级Harness架构:三层记忆系统(Filesystem/RAM/Context Window)、工具分类与安全设计、硬沙箱vs软沙箱隔离策略、以及Orchestrator-Worker多Agent编排模式。
2026年最热门的个人AI Agent框架对比:OpenClaw拥有24万开发者和5700+ Skills,是生态最庞大的选择;Hermes Agent以自改进学习循环和6种安全后端另辟蹊径。本文深度对比两者的技术内核、安全机制、记忆系统和真实用户体验,给出选型建议。
Anthropic于2026年4月16日发布Claude Opus 4.7,CursorBench 70%超越Opus 4.6的58%,视觉能力98.5%飞跃,定价与4.6相同。本文完整解析核心升级点、第三方评测、定价及与Mythos的关系。
AI Skill 使用指南· №5
本文是基于OpenClaw/Codex官方规范写的完整指南,手把手教你从零写出一个标准、规范、可分发的Skill。涵盖SKILL.md结构、触发词写作、scripts/references/assets规范,以及完整示例。
AI Skill 使用指南· №4
OpenClaw内置60+ Skills,覆盖飞书集成、日历管理、智能家居、文件处理等场景。本文详细介绍OpenClaw Skills的使用方法、如何从clawhub.ai安装新Skills,以及如何创建自己的自定义Skill。
AI Skill 使用指南· №3
OpenCode是2026年最热门的开源AI编程助手,支持Skills扩展生态。本文是快速上手指南,详细介绍OpenCode安装、Skills安装和使用方法,以及如何组合使用多个Skills完成专业级项目。
AI Skill 使用指南· №2
AI Skills是2026年最热门的技术方向之一。本文是入门教程,用通俗易懂的语言解释什么是Skills、它和Tools的区别、以及普通人如何开始使用Skills提升工作效率。
AI Skill 使用指南· №1
2026年AI领域最热门的方向不是大模型本身,而是Skills技能系统。本文深度解析AI Skills的技术原理、MCP/A2A协议栈、三国志框架生态(LangChain vs AutoGen vs CrewAI)、以及这场"技能之战"背后的战略逻辑。
一、OpenClaw 是什么 OpenClaw(曾用名 Clawdbot / Moltbot)是一个开源的本地优先个人 AI 智能体网关,由奥地利工程师 Peter Steinberger(PSPDFKit 创始人)于 2026 年 1 月正式开源
Claude Code 源码泄露深度分析:51 万行代码背后的 AI Agent 架构设计 本文基于 2025 年 3 月 31 日 Claude Code npm 包 source map 意外泄露事件,对其源码进行深度技术分析。 事件背景 2026 年 3 月 31 日,Anthropic
2026年,AI大模型战场正经历前所未有的格局重塑。从OpenAI、Google、Anthropic三巨头领跑,到国内通义千问、智谱GLM、Kimi、豆包等模型强势崛起,大模型评测已成为技术选型的关键参考。本文基于2026年最新评测数据,带您深入了解主流评测体系与模型表现。
AI Agent 智能体研究报告:技术架构与前沿进展 撰写:Kevin 日期:2026年3月31日 1. 引言:从 LLM 到 Agent 1.1 什么是 Agent? 在 AI 领域, Agent(智能体) 指的是能够感知环境、制定计划、执行行动并从反馈中学习的自主系统。与传统的「输入
当 LangChain 团队在 Terminal Bench 2.0 上把他们的编码 Agent 从 Top 30 拉到 Top 5 时,他们没有换模型、没有加数据、没有做微调。他们只改了一样东西——Harness。12 这个结果揭示了一个正在重塑软件工程的事实:模型是商品,Harness 才是护城河。 本文将从概念起源、核心架构、三大支柱、工程实践和未来演进五个维度,对 Harness Engineering 进行一次完整的技术拆解。
从脚本自动化到智能体驱动: 多年来,开发者使用 Selenium、Puppeteer、Playwright 等工具自动化浏览器操作。这些工具功能强大,但本质上是"脆性"的——我们编写依赖特定 CSS 选择器、XPath 或元素 ID 的脚本,一旦网站 UI 发生变化,脚本就会崩溃,维护成本极高。 2024 年末至 2025 年初,一种全新的范式开始崛起:让大语言模型(LLM)直接"看懂"并"操控"浏览器。Browser Use 正是这一浪潮中最具代表性的开源项目之一。它由 Magnus Müller 和 Gregor Žunić 创建,是一个基于 Python 的开源库,通过将 LLM 的推理能力与 Playwright 的浏览器控制能力相结合,让 AI Agent 能够像人类一样浏览网页、点击按钮、填写表单、提取数据。 与此同时,2025 年下半年,OpenAI 在其内部 Codex 项目中提出了一个影响深远的工程理念——Harness Engineering(驾驭工程)。这一理念的核心观点是:在 AI Agent 时代,工程师的核心工作不再是编写代码,而是设计环境、明确意图、构建反馈回路,使 Agent 能够可靠地工作。 本文将深入剖析 Browser Use Agent 的技术架构、核心原理和实现细节,并结合 Harness Engineering 的最新理念,探讨如何在生产环境中构建可靠的浏览器自动化智能体系统。