主题文章
AI 与 Agent
从模型输入输出开始,逐步构建具备检索、工具、记忆、证据和质量治理的知识 Agent。97 篇文章模型、调用与 Agent 基础
LLM、工作流、RAG 与 Agent 如何分工用同一个知识查询任务比较模型生成、固定编排、外部检索和受限行动循环。Message、Token 与上下文:模型一次调用看到了什么沿一条请求解释消息角色、分词、输入窗口、输出预算和停止原因。用 Python 调用一次 Responses API从环境、凭证和请求字段走到同步输出、usage、流式事件和错误分类。结构化输出约束格式,不证明业务事实说明 JSON Schema 能保证什么,以及身份、权限、版本和证据为何仍由程序确认。Agent 的定义、自主性与责任边界把目标、状态、动作、观察和终止条件放回应用运行时,说明有限自主性怎样形成。什么是 Agent 循环不用框架实现一次有限行动循环,观察决策、执行、状态更新、异常和终止。哪些任务不该使用 Agent从控制图、失败代价、审计要求和分支不确定性判断固定程序、工作流或 Agent。
工具、MCP 与 Skill
Tool Calling 的提议、校验与执行契约拆开工具描述、参数 Schema、模型候选、可信上下文、执行结果和错误回传。并行工具执行怎样保持身份、顺序与预算判断调用级并发安全,处理结果身份、超时、取消、共享预算和部分失败。MCP 的系统位置与能力边界从 Host、Client、Server 和能力协商理解 MCP 与 Tool Calling、API、Skill 的关系。MCP 从初始化到关闭的协议生命周期沿连接、版本协商、能力发现、调用、进度、取消、重连和关闭追踪 JSON-RPC 消息。用 Python 实现 MCP Server 与 Client实现只读工具并验证发现、调用、参数错误、超时和资源释放。Skill 怎样按需加载任务知识说明触发、目录、渐进式披露、脚本与资源怎样降低常驻上下文。Hook、事件与人工审批怎样约束执行把观察、拦截、审批和审计放入动作前后,区分生命周期 Hook 与业务策略。
上下文工程与记忆
上下文工程怎样装配一次模型输入把规则、问题、历史、记忆、检索证据和工具结果放进有限输入预算。上下文窗口怎样保留近期状态与关键事实比较滑动窗口、优先级裁剪和外部状态引用,说明各自损失的信息。上下文压缩怎样选择保留与丢弃解释触发阈值、摘要输入、不可压缩字段、失败回退和压缩后的验证。分层压缩怎样保护近期工作状态按距离当前决策的远近分层处理历史、工具结果和工作文件,并限制摘要误差传播。Tool Result 预算、预览与外部引用处理大搜索结果和并行工具输出,用预览、稳定指针和生命周期约束避免窗口溢出。延迟工具加载与 Tool Search让模型先发现相关工具,再加载完整 Schema,同时保留必需工具、授权和缓存边界。Prompt Cache 的稳定前缀与失效边界解释前缀匹配、断点、缓存键、字节稳定性、权限变化和命中测量。Agent 记忆怎样写入、检索、更新和遗忘区分会话状态、用户记忆和事实知识,建立来源、范围、置信度、过期与撤回规则。多轮对话怎样保存状态与处理指代从 Conversation、Turn 和 Message 的关系解释历史装配、焦点切换、并发消息和标题生成。上下文污染与间接提示注入追踪恶意内容怎样从文件、网页、记忆和工具结果进入输入,并在装配前标记和隔离。
单 Agent 推理
Router 怎样选择执行模式根据任务范围、时限、风险和证据要求选择固定回答、快速检索或研究循环。Planner 怎样生成受限的 SearchPlan让计划描述目标、分支、依赖、范围、预算和停止条件,执行权仍留在运行时。Reflection 如何验证答案并限制修复从可观察问题、证据绑定和停止条件出发,解释 Reflection 如何检查答案、生成具体反馈并完成一次受限修复。推理过程的使用边界与审计记录区分模型内部推理、可公开解释和运行时决策记录,避免把隐式理由当事实证据。Tree of Thoughts:候选路径如何搜索把 Tree of Thoughts 拆成状态、候选生成、评分、剪枝、回溯与预算控制,并用可运行的 Best-first 搜索验证停止条件。Debate 模式:如何用证据处理分歧从独立立场、交叉质询到证据裁决实现 Debate,说明为什么共识和多数票不能替代事实、权限与业务验证。
多 Agent 与研究
多 Agent 编排的职责、状态与成本从单循环拆出多个角色,明确输入输出、共享状态、预算和失败责任。DAG 工作流怎样表达依赖与并行用有向无环图表达稳定依赖,处理拓扑顺序、扇出、汇合、部分失败和重试。Swarm 模式的局部协作与全局约束解释去中心化选择带来的灵活性,以及预算、权限、重复工作、工作区和收敛问题。Handoff 怎样移交任务、上下文与责任设计移交包、共享工作区、消息和回收控制,让接收方知道目标、权限和返回条件。SubAgent 的上下文隔离与任务契约用窄契约限制资料、工具和输出,处理超时、冲突、父任务取消和结果合并。Deep Research Agent 怎样组织多轮检索从问题分解、并行搜索、来源审查到补缺,建立有预算的研究循环。研究综合怎样判断覆盖度与冲突把问题维度、证据包、已知缺口和来源冲突分开,再生成有范围的结论。研究任务的停止条件与引用失败用覆盖度、截止时间、轮数和边际收益停止循环,并拒绝无法核对的关键结论。
RAG 知识工程
RAG 的系统位置、策略与升级路径从固定检索到混合检索和研究循环,比较数据流、控制流、成本与适用边界。文件上传、准入与对象存储设计上传协议、文件校验、内容哈希、Manifest、重复上传、对象生命周期和失败清理。多格式文档解析与 OCR统一处理 Markdown、HTML、PDF、Office 和扫描件,记录解析警告并在 OCR 不可用时失败关闭。Block 文档模型怎样保留结构与来源定义段落、标题、代码、表格和页码等 Block,区分显示文本、检索文本和稳定来源 ID。语义切块怎样保留章节与邻接关系按语义边界、目标长度和最大长度生成 Chunk,保留父节点、相邻关系和稳定身份。表格怎样生成可检索的结构化 Chunk保留表头、行字段、整表内容和业务编号,并处理超大表、空列和重复行。Chunk 质量门禁与回归检查检查内容保留、重复、孤立邻接、超限切块和失败记录,让切块变化可回归。Embedding 表示什么,不能证明什么解释向量空间、相似度和语义邻近,说明权限、时效、精确编号与事实正确性不能由距离替代。Embedding 文本、模型与版本元数据区分正文、显示文本、回答文本与 embedding_text,并保存模型、维度、规范化和版本信息。Embedding 批处理、重试与幂等处理批量并发、内容哈希、部分成功、失败重试和重复任务,避免重算污染候选版本。候选索引怎样原子激活与回滚区分候选版本和活动版本,处理校验、过期任务、补偿、旧版本服务和重新索引。pgvector 存储、索引与向量检索从查询向量、距离函数和精确基线进入 HNSW、IVFFlat、过滤、Top K、邻接补全、召回验证与降级。查询理解怎样固定意图、实体与权限范围用一次结构化理解提取意图、实体、时间、别名、指代和显式范围,不靠业务词特判。查询改写、问题分解与分支预算比较 Multi-Query、HyDE 和 Step-back,确保实体、时间与权限不漂移并限制分支膨胀。精确、全文与结构化检索怎样协作为业务编号、中文词项、表格字段和严格查询设计通道,并只在受控条件下放宽。混合检索的融合、去重与重排并发运行多条检索通道,保留候选身份,用 RRF 融合并在超时边界内重排。Evidence 预算、缓存与 Singleflight按问题覆盖选择证据,缓存键绑定查询、权限、知识版本和检索配置,命中后重新鉴权。Wiki、Alias 与知识治理设计主题卡片、摘要、别名、人工修改、自动生成和版本更新,不让别名猜测替代事实。知识图谱怎样从证据构建节点与边区分确定性关系和语义抽取,保存稳定 ID、来源、构建版本、属性过滤和失败回滚。图谱辅助检索的路由、扩展与回退用 Alias 和 Wiki 路由实体,受限扩展子图并把关系绑定到来源,图谱失败时退回普通检索。RAG 的 ACL 与知识版本链让用户范围和 Release 贯穿检索、缓存、重排、证据、引用和答案验证。用 Recall、MRR 与 nDCG 评估检索建立带标注查询集,计算召回、首个相关位置和排序质量,并分析权限与版本回归。
证据、质量与安全
Claim、Evidence 与 Citation 怎样对应把答案拆成原子断言,让每条事实绑定当前用户可见证据和准确位置。答案验证、有限修复与安全拒答沿事实、引用、权限、隐私和新鲜度检查答案,只修可修问题并保留原始证据。Agent 安全从信任边界开始区分系统策略、用户输入、记忆、检索内容和工具结果的信任等级及传播规则。安全执行怎样限制文件、网络与进程组合沙箱、最小权限、资源配额和人工确认,约束具有副作用的工具。Agent 策略怎样版本化、灰度与回滚将模型、提示、工具、预算和质量门禁保存为不可变策略版本,并控制发布范围。多租户 Agent 的身份、状态与证据隔离让租户边界贯穿认证、Turn、检索、缓存、事件、工具和审计。Agent Eval 怎样覆盖检索、回答与运行时用固定用例同时检查范围、召回、引用、拒答、终态、恢复和语义判定不可用。用户反馈怎样进入可控优化流程把采纳、拒绝、原因和纠正转成评测数据,再经过 Challenger、Canary 和回滚。
Runtime 与异步执行
Agent Runtime 的领域模型与状态归属区分 Conversation、Turn、Message、Event、Task、Release 和 Policy 的生命周期与所有者。一次 Agent 请求怎样穿过 API 与 Runtime从创建 Turn 到异步执行、事件持久化、流式读取和终态查询,解释每层职责。Turn 幂等与版本快照用幂等键处理重复请求,并在开始时固定知识 Release、Policy、模型和权限范围。从 DAG 到 Agent Loop 的运行时选择比较静态依赖图和运行时行动循环,说明生产系统为何常把两者组合。持久化 Agent Loop 的检查点与重入选择检查点边界,重新发现未完成 Turn,并让恢复过程重新经过授权和幂等检查。运行中的追加、撤回与中断区分 accepted、committed 和 completed,在决策边界处理新消息、竞态和交付确认。取消、Deadline、Checkpoint 与恢复区分主动取消、阶段超时、进程崩溃和重试,避免恢复时重复副作用。Watchdog 怎样识别阶段超时用阶段模型区分软空闲、硬空闲和流式空闲,处理嵌套调用与跟踪器失真。卡循环检测的信号、裁决与修复组合重复动作、无状态变化、错误循环和进度信号,避免探测器替代根因修复。Agent 准入控制、并发配额与 Lease在任务进入执行前分配容量,用租约区分活跃 Worker、失联执行和可重试任务。Celery Worker 的 ACK、Lease 与重复投递说明至少一次投递下的任务领取、晚确认、Worker 丢失、续租、重试与幂等。SSE 事件的序号、重放与轮询降级持久化递增事件序号,按 Last-Event-ID 重放,并在流式连接失败时读取终态。Temporal 怎样执行可恢复的长流程区分 Workflow 与 Activity,解释事件历史、确定性重放、重试、Signal、Query 和版本演进。
生产架构
生产 Agent 的三层架构与调用边界拆开 API 编排、Agent Runtime 和能力服务,明确状态、数据与失败各归谁处理。生产 Agent 的组件职责与失败传播把 API、Runtime、Worker、模型、检索、数据库、对象存储和观测放进同一故障图。Trace 怎样串起模型、检索、工具与验证设计跨节点 Trace、Metric 和 Log,区分延迟、错误、质量、成本和资源问题。Token 预算与分层模型路由按任务阶段分配输入输出预算,再根据能力、时限、风险和降级状态选择模型。后台 Agent 的调度、预算与孤儿回收为后台任务定义身份、触发器、时区、幂等、预算、暂停、过期、通知和清理。
Harness 与交互式 Agent
Agent Harness 的职责与接口说明 Harness 怎样统一模型、工具、上下文、状态、权限、运行时、评测和观测。Computer Use Agent 的观察、动作与验证循环把截图或可访问性树观察、动作提议、确认、执行和重新观察组成受控循环。Computer Use 的视觉上下文管理区分浏览器图像和用户图像,处理采集大小、图像老化、幂等缓存、引用和对话契约。编码 Agent 怎样从仓库证据走到验证结果沿读取约束、定位代码、修改、测试、审查和交付解释编码 Agent 的控制流。OpenClaw 时代的本地工具与权限引擎比较可访问性树和坐标控制,说明 Hook、权限分层、循环检测与本地优先的代价。本地 Agent 的 Daemon、渠道与人工介入处理命名 Agent、状态边界、双向 MCP、调度、Watcher、Heartbeat 和人工接管。Agent Harness 怎样成为可治理的平台将协议适配、运行时、沙箱、策略、评测和观测做成可替换的平台能力。