求职数据管线 · Agent 作品集
从分散岗位信息到可投递短名单的闭环:先做需求分析,再让长时间运行的 Agent 扩量抓取, 再用对抗审把「看起来在招」和「现在真能投」拆开。
- 只使用公开免登录来源;登录墙与他人凭证直接放弃。
- 人负责问题定义、边界与验收;AI 负责长时间可审计的收集与初筛。
我是 马旭鹏,做 AI Agent / 应用工程。 这里不是简历页,是作品展:每个项目都能点进去看真实产物。 代表作包括求职数据管线 236 → 1251 → 249、 公网语义检索,以及自托管数字花园。
从分散岗位信息到可投递短名单的闭环:先做需求分析,再让长时间运行的 Agent 扩量抓取, 再用对抗审把「看起来在招」和「现在真能投」拆开。
自托管的公开笔记花园:只发布明确标记可公开的内容,敏感材料物理隔离,不依赖付费托管。
把长期阅读资产做成可语义召回的知识库:离线建卡,在线检索,目标是「找到那篇卡」,不是现编答案。
对本人可授权的真实聊天做结构化分析:抽取、归类、汇总。强调工具调用与数据边界,不展示原始隐私内容。
为执行 / 审查 / 长期捕捉等多 AI 角色设计的行为治理:规则与记忆版本化,候选规则必须人工审批后晋升。
岗位分散、页面真假难辨、转行表达容易空。不能靠海投碰运气。
不信 AI 自报。逐源核验“现在是否开放”,把关闭岗、聚合页壳、论坛帖从可投递集合里拆出去。
目标定义、来源边界、验收标准、风险控制、结果决策。代码实现可由 AI 生成,但工程结论必须能回到数据文件。
不信自报 exit 码、不信“检测通过”。用实物数量、源 URL、运行态回查做验收。
公开/私有、可登录/免登录、候选/正式层,先定不能碰什么,再扩能力。
能公网点开的优先公网点开;不能公开的只给机制与口径,不拿截图冒充系统。
人工精选岗位作为种子,先定「什么算目标岗位」的口径,再谈扩量。
把转行背景与目标翻译成检索条件、筛选标准和排除条件,写在 Agent 开工之前。
长时间运行的 Agent 按来源边界扩量。只用公开免登录来源;登录墙与他人凭证直接放弃。
从 1251 条中按口径筛出 300 条候选,进入人工审计集合。
不信自报,逐源核验「现在是否开放」:300 条里仍有 51 条不能直接投(关闭/暂停 40 + 聚合页壳 11)。
关闭岗、聚合页壳、论坛帖分别归置,不混进可投递集合。
开放 206 + 论坛 43。每条都能回到源 URL 与数据文件。
验收看实物,不看声明。AI 报「完成」「通过」都不算数,能数出来、能回查的东西才算数。
· 求职数据管线:300 条“实锤”逐源回查「现在是否开放」,拆出 51 条不能直接投的(关闭/暂停 40 + 聚合页壳 11)。
· 验收三件套:实物数量、源 URL、运行态回查——三者对得上才收口。
· 不信自报 exit 码,不信日志里的「检测通过」。
先定「不能碰什么」,再扩能力。边界写在配置和流程里,不靠自觉。
· 求职数据管线:只用公开免登录来源,登录墙与他人凭证直接放弃。
· 数字花园:公开/私有靠人工标记 + 预过滤 + 二次过滤,配置写错也漏不出整库。
· Northstar:候选规则与正式规则分层,候选必须人工审批后才晋升。
能公网点开的优先公网点开;不能公开的只给机制与口径,不拿截图冒充系统。
· 数字花园、慢读语义检索:公网 live,可直接点开验证。
· 微信记录分析、Northstar:涉及隐私与内部治理,页面上只给机制和数据口径,明确标注「说明卡 · 无公开演示」。