Agent
理解面向对话的模型、知识、工具、记忆与发布生命周期
Agent 是面向多轮对话的 AI 应用。它把一个团队授权的对话模型,与系统提示词、变量、知识库、工具、记忆、附件和媒体生成设置组合在一起。
编排与运行
Agent 的编辑页由编排表单和实时预览组成。提示词支持 {{变量名}};用户变量在编辑器里可选文本、段落、下拉选项、数字、复选框,以及数组、对象和文件/图片类型(文件类变量用于接收附件)。系统变量 {{query}} 表示当前用户输入。
Agent 每轮最多执行 1-200 次工具迭代,默认 5 次。达到上限时,本轮以 max_iterations_reached 终止,而不是无限调用工具。
运行是异步且持久的:每次发送都会提交一个 AgentRun 到 agent 队列,由主 Worker 执行模型调用与工具循环,客户端通过 SSE 跟随事件流并支持断线重连(见 系统架构)。任务不自动重试——重试会重复执行有副作用的模型与工具调用——所以部署时必须保证有 Worker 消费 agent 队列,否则运行只会停在 queued 且不报错。
RAG 模式
| 模式 | 行为 |
|---|---|
off | 不检索知识库 |
auto(Naive RAG) | 每轮在模型调用前自动检索已关联知识库 |
agentic(默认) | Agent 判断何时检索知识库 |
每个知识库关联可独立配置检索方式、Top K 和阈值。检索方式为 vector、fulltext 或 hybrid。
对话、分支与压缩
会话在首次消息时隐式创建(请求不带 conversation_id 即新建会话,并同步累加 Agent 与团队会话计数)。用户可以编辑消息或重新生成回复;系统保存版本并维护活动分支。长对话在模型调用前执行上下文预算检查,可压缩旧推理、工具结果和历史轮次,同时保留近期原始轮次。请求时压缩默认开启(context_compression_config.enabled),生成的摘要目标 token 预算默认 1000(可配 128-8000);压缩以「带水印的摘要 + 近期原始尾部」的方式替换旧轮次,被摘要覆盖的历史用 context_summary_watermark_id 标记,不会把最近几轮原文一起吞掉。
记忆
记忆默认关闭(enable_memory=false)。开启后 Agent 可跨会话检索用户信息:每次默认最多注入 10 条记忆(max_memories_per_retrieval 可配 1-50),自动提取默认开启(auto_extract),自动提取的最低重要性默认 medium(可选 low / medium / high)。关闭自动提取只停止写入,已存记忆仍会被检索注入。
记忆与会话上下文的边界不同:会话上下文属于单个会话,记忆按用户存续——检索只按 user_id 过滤,不区分 Agent 与团队。因此同一用户在不同 Agent 中产生的记忆会互相可见;共享账号或一个账号承担多种身份时要谨慎开启。用户可以在 记忆 页查看和删除自己的记忆。
发布与可见性
Agent 状态只有草稿与已发布。可见性为私有或团队;旧的 public 值会向后兼容地规范化为团队可见。发布后可使用公开对话页、嵌入页和 API;发布权限与编辑权限分开控制。
相关内容:创建 Agent、Agent 配置参考、聊天 API。
这篇文章对你有帮助吗?