Agent 工作流设计
将任务拆成意图、检索、生成、校验、执行和结果回填。证据:Text2SQL 与 Agent Gateway。
AI Agent 产品与工程实践|数据科学硕士(计算语言学 / NLP)|广州
我围绕 RAG、Tool Calling、结构化校验和人机协同,构建可解释、可测试、可回退的 AI 应用原型;同时具备企业 AI 付费交付、Java 服务端 Agent 原型和模型任务评测经验。
从应用架构、工具调用、检索和评测四个层面了解项目实践。
将任务拆成意图、检索、生成、校验、执行和结果回填。证据:Text2SQL 与 Agent Gateway。
使用白名单、Schema、只读环境、人工审批和审计记录控制执行风险。
实践文档切分、召回、重排和最小 MCP 工具协议,保留可复核测试记录。
具备企业 AI 付费交付、Java 服务端原型和模型任务评测经验。
有偿外部委托|独立设计与开发|客户独立运行后验收付款|客户资料保密
客户需要从若干上市公司年报中筛选指定主题语句并识别情感态度,但没有指定技术实现。我负责把重复性文本处理收束为可批量输入、可结构化导出、可由客户独立操作的桌面工作流。
功能完成只是一个信号;还要判断哪里会错、谁来兜底,以及证据是否支持继续扩围。
每个判断都保留四个要素:初始做法、偏差信号、纠偏动作与可复用原则。
预检阶段判断证据能否进入规则审核,最终审批由费用会计负责。
REJECT。FLAG,输出补证或人工核实动作。FLAG,审批结论继续由人工负责。12/12 条边界测试通过,只能证明关键规则被实现;30 条标注样本的决策准确率为 63.33%,低于预设 80% 门槛。
查询即使能生成执行计划,仍可能包含无关联 JOIN 或触及敏感字段;因此可执行性不能代替风险判断。
每项只回答三件事:任务是什么、关键判断是什么、目前有什么可复核结果。
任务:验证 Tool Calling 的接口契约、白名单工具、有限轮次、失败分类与 trace。
判断:模型只提出调用意图,服务端决定工具权限与执行边界。
任务:将会议纪要与群聊记录整理为七模块状态卡片。
判断:上游抽取可以不稳定,但来源、脱敏、Schema 校验、冲突检测与安全导出必须由确定性流程兜底。
任务:连接用户授权的微信读书数据,完成可视化、概念分析与结构化导出。
判断:公开仓库需要把依赖、密钥配置和运行方式讲清楚,才能形成可复现入口。
我在 OpenClaw 与 Hermes 两种执行环境下,对 5 个代号模型执行 3 类复合任务,记录工具调用、文件处理、代码执行、数据分析与产物保存表现。
我将营养咨询拆为用户档案、目标计算、每日记录、进度看板、场景建议与周期复盘,覆盖 12+ 健康管理场景(公开产品说明),并设置特殊人群与健康安全提示。
我用 LangChain 与 LlamaIndex 分别实现 RAG 管线,对照切分、Dense + BM25 召回与 RRF 重排;同时用 Python 标准库实现 JSON-RPC 2.0 over stdio 的最小 MCP server。
initialize、tools/list 与 tools/call 冒烟测试。三条原则分别约束问题定义、人机责任与扩围决策。
明确用户、流程、完成标准和失败类型,再判断是否需要引入 AI。
模型提出候选,规则拦截确定风险,人工对高风险业务动作负责。
预先设定门槛与验证条件,让样本表现、测试和真实交付影响实现范围。
我希望参与 AI 产品的需求拆解、评测标准定义与交付闭环,把模型能力转化为可验证、可协作的人机工作流。