日期:2026-06-17 · 版本基线:v1.4.2 视角:从"智能体质量"出发,对标当前主流智能体平台,评估 lambdagentpaas 的智能体实现并给出建议。 证据:本评估锚定 2026-06-14~17 期间真实运行复盘(run_id / commit 见正文),非空谈。
| 维度 | 含义 | 业界标杆 |
|---|---|---|
| 执行可靠性 | 让它干的事是否真发生:工具真执行、产物真落盘 | Claude Code / Codex 原生 harness |
| 上下文 / 收敛性 | 记得住、往前走 vs 忘了、乱跳重做 | LangGraph(state/checkpoint)、原生 harness |
| 可复现 / 隔离 | per-run 隔离、可追溯 | Dify / LangSmith |
| 可度量(eval) | 能给智能体输出质量打分、回归测行为 | LangSmith / Braintrust / Ragas |
| 安全 / 约束 | 沙箱、权限、防幻觉/伪造 | 各家在补 |
| 形式化根基 | 类型 / 效果 / 成本语义、可证明保证 | 几乎无人有 —— lambdagentpaas 独有 |
6758ff8):意识到 claude-code 应"当 agent 本身"而非套 react-over-text 封装。1. react-over-text 车道从根上脆(头号问题)
让模型把工具调用当散文手写 {"tool":...}、平台正则抠并自己执行。并发症(均实锤):
input 裸串、path vs file_path、格式飘)。2. 没有 eval / 质量度量 全程模式是"跑一条 → 人肉看 trace → 发现没落盘 → 修"。有代码单测(lambdagent 594 + agentpaas 344),但零条"智能体行为"测:给定输入、产物是否达标。测不了 → 改不动 → 只能人肉当 eval,不可扩展、不可回归。
3. 上下文管理原始
手搓 max_input_chars / obs 截断 / history 裁剪 → 直接导致"忘了→乱跳→重做"(qwen-max 30720 溢出 commit 787126d;乱跳 commit fc93ae3)。PROGRESS.md 磁盘纪律很聪明,但本质是给弱上下文管理打补丁。主流用 summarization + 检索 + checkpoint。
4. 可靠性是打地鼠 dir / session / MCP / 401 / context / network 反应式逐个修。根因:react loop + 上下文是手卷的,provider 怪癖靠一个个 case 兜。LangGraph 的 loop/state/checkpoint 是被打磨过的原语。
tools + tool_calls;Anthropic 走 native tool_use;claude-code 保持 native 车道。react-over-text 仅留给真不支持 function-calling 的模型当兜底。providers/openai_compat_provider(加 tools 透传 + tool_calls 解析)、conversation.py(消息含 tool role)、compiler._compile_react(不再正则抠文本,改读结构化 tool_calls;_extract_tool_call 退化为兜底)。两车道架构不变,等于给 react 车道换"可靠引擎"。input 裸串、path 别名类 bug 归零。先在 qwen-plus 验证。注(codex 修正):function-calling 只消灭"格式漂移 / JSON 抠错 / 裸串 input / 工具名解析"这一类。"相对路径落错目录"不在其中——那是 workspace contract + cwd 绑定 + sandbox + 参数 canonicalization 的工具层硬约束问题(
file_tools._resolve/_sandbox, commit5f38a1c/3bae21d/df648aa已部分解决)。FC 与工具层约束是两件事,别把后者算进 FC 收益。
tests/test_pipeline.py 已有 LLM-judge gate、阈值、halt、
成本进 term graph——eval 基础设施长出来了一截。真正的缺口是:有 pipeline/gate 单测,
没有第一方 agent 的"行为回归集"(真实智能体质量没被覆盖)。estimate_cost 对账,准确率作卖点);engine/pipeline 的 cost/gate/effect 接到 UI + 运行时 + Skill 挂载校验。问题不是"react-over-text 写得不够好",而是它本来就不该当主执行引擎。
react-over-text 这个抽象边界不适合承担 workspace agent 的主执行路径——这两天的失败不是
几个 bug,是用错了执行车道。代码自证:agentruntime/action_parser.py(free-text 抠 JSON/XML/
keyword、裸串塞 {"query":...} = path/file_path/input 飘的来源)、openai_compat_provider.py
(请求体无 tools/tool_choice/tool_calls)、claude_code_native.py 注释(react=纯文本正则抠、
native=结构化执行)、agents.py(注释直接写 react-over-text 实测"0 执行、丢上下文、空转")。
react-over-text → 降级为 legacy / fallback,不再作为主车道。
native harness → Claude Code / Codex 负责 workspace agentic 执行。
structured tool-call → Qwen / OpenAI / DeepSeek 走原生 tools/tool_calls。
formal layer → 只管 contract / policy / migration / eval / trace / cost / effect。
LambdAgent 的胜负手不是"更会干活",而是让 Skill / Agent 在不同执行后端之间 可分析、可约束、可迁移、可回归。
落地顺序:① 原生 function-calling + react 降级为 fallback(根治执行)→ ② 第一方 agent 行为回归集(建尺子)→ ③ formal layer 兑现成可见保证(护城河)。
本评估方向对、80% 准、且准在痛处(把"模型不听话"改名成"执行车道选错了")。codex 三处修正已并入上文: