作品展 Portfolio Showcase
可点开 · 可核验 · 不堆术语

把 AI 做成能验收的交付系统

我是 马旭鹏,做 AI Agent / 应用工程。 这里不是简历页,是作品展:每个项目都能点进去看真实产物。 代表作包括求职数据管线 236 → 1251 → 249、 公网语义检索,以及自托管数字花园。

主叙事 · 求职数据管线:从种子到短名单
全链路可回到数据文件核验
种子语料
236
人工精选岗位
Agent 扩量抓取
1251
公开免登录来源
优选审计
300
从 1251 中优选
对抗审
−51
关闭/暂停 40 · 聚合页壳 11
可投递短名单
249
开放 206 · 论坛 43
不信 AI 自报:300 条“实锤”里仍有 51 条不能直接投——对抗审把它们拆出了可投递集合。
No.1

作品

优先放能点开、能讲清机制的项目
02
Live 发布工程 内容治理

数字花园 · 选择性公开发布

自托管的公开笔记花园:只发布明确标记可公开的内容,敏感材料物理隔离,不依赖付费托管。

公开无密码 双保险过滤 图片本地化
  • 预过滤 + 二次过滤:配置写错也漏不出整库。
  • 外链图片构建期本地化,避免防盗链裂图。
  • 作为「会把内容系统做成可分享产品」的现场证明。
打开花园 公网可点开
03
Live RAG 语义检索

慢读语义检索

把长期阅读资产做成可语义召回的知识库:离线建卡,在线检索,目标是「找到那篇卡」,不是现编答案。

887 原文 930 候选卡 5634 概念
  • 三层:原文/解读卡 · 概念图谱 · 向量召回。
  • 查询端走 embedding 相似度,边界清晰、可演示。
  • 适合讲清 RAG 真正解决的是检索问题,不是聊天包装。
打开演示 公网可点开
04
Agent 工具调用 数据分析

微信记录分析 Agent

对本人可授权的真实聊天做结构化分析:抽取、归类、汇总。强调工具调用与数据边界,不展示原始隐私内容。

6595 条消息 23 天跨度
  • 真实数据量可核验,展示层只保留结果口径。
  • 场景是「Agent + 本地数据工具」而不是通用聊天机器人。
能力边界说明 说明卡 · 无公开演示
05
Multi-Agent 规则治理 人工审批

Northstar 多角色 Agent 治理

为执行 / 审查 / 长期捕捉等多 AI 角色设计的行为治理:规则与记忆版本化,候选规则必须人工审批后晋升。

规则 81 记忆对象 29 可回滚
  • 把“AI 越用越乱”变成可审计的规则层与记忆层。
  • 从历史失败重试中提炼预检规则,而不是只写口号。
看方法原则 说明卡 · 无公开演示
No.2

主作品机制摘要

求职数据管线
种子 236 需求分析 Agent 抓取 1251 优选 300 对抗审 清洗分流 短名单 249
问题

岗位分散、页面真假难辨、转行表达容易空。不能靠海投碰运气。

关键验收

不信 AI 自报。逐源核验“现在是否开放”,把关闭岗、聚合页壳、论坛帖从可投递集合里拆出去。

我负责什么

目标定义、来源边界、验收标准、风险控制、结果决策。代码实现可由 AI 生成,但工程结论必须能回到数据文件。

No.3

方法

跨项目反复出现的做法
01

对抗式核验

不信自报 exit 码、不信“检测通过”。用实物数量、源 URL、运行态回查做验收。

02

边界先于功能

公开/私有、可登录/免登录、候选/正式层,先定不能碰什么,再扩能力。

03

演示即证据

能公网点开的优先公网点开;不能公开的只给机制与口径,不拿截图冒充系统。

No.4

关于这个站

作品展,不是简历页

本站只放可演示作品与公开入口。简历、手机号、投递材料不在这里。

背景是半导体设备机械设计现场经验 + 大模型应用转向。关注点是:把 Agent、检索、发布、治理做成能跑、能验收、能复盘的系统。

若你在看机会:先点上面的 live 演示,再决定要不要继续聊项目细节。

Python LLM / RAG AI Agent Prompt / Context Embedding Node.js Docker Nginx