PeopleSearchBench —— 首个面向 AI 找人智能体的开源评测基准
提出 Criteria-Grounded Verification:把一个查询拆成若干可独立核查的判据,逐条对外部信源验证,而不是让模型直接打分;在 119 条多语言查询上与人工标注的一致性达到 Cohen's κ = 0.84。
// 简历
AI Agent 研发工程师,具备后端、大数据与智能体全链路工程能力,能独立推进 Agent 架构、工具与上下文工程、效果评测到线上稳定性的完整落地。现于超线性科技负责找人 AI Agent(Lessie AI)核心系统,主导多 Agent 架构、工具调用优化与评测体系建设,开源评测基准 PeopleSearchBench 被 EMNLP 2026 Industry Track 录用(通讯作者)。此前深耕后端与大数据,先后在扬腾自研仓储 WMS、在腾讯做亿级数据采集与风控。
深圳大学 本科 数学科学学院 数学与应用数学
提出 Criteria-Grounded Verification:把一个查询拆成若干可独立核查的判据,逐条对外部信源验证,而不是让模型直接打分;在 119 条多语言查询上与人工标注的一致性达到 Cohen's κ = 0.84。
把人物与公司的发现、资质判断与信息增强封装成编程智能体可直接调用的 Skill。
在命令行完成找人、信息增强与网络调研,已发布 14 个版本并提供 macOS / Linux / Windows 预编译二进制;MCP Server 则把同一套能力以自然语言接入 Claude Desktop。