Sunday 的面试指南

Deep Research Agent 怎么设计?怎样保证研究报告的引用可靠?

🧑‍💻 面试官:让 Agent 搜索几十个网页,再写一份报告,就算 Deep Research 吗?

🙋‍♂️ 我:它还应该拆分问题,多轮搜索,并把来源放进报告。

🧑‍💻 面试官:十个网页转发了同一条错误消息,能算十份支持证据吗?

🙋‍♂️ 我:不能,要识别它们是否来自同一个原始来源。

🧑‍💻 面试官:那报告标了一个真实网址,但网页根本没说它前面的结论,你怎么发现?

这道题要讲清「结论和证据怎样对应」:搜得多不等于研究充分,链接存在也不等于引用成立。

面试速答(60 秒版)

Deep Research Agent 需要围绕一个研究目标,拆出待回答的问题,再根据搜索结果继续补充证据,最后形成报告。它不只是一次搜索结果的摘要。

设计时,可以把待研究的问题、已取得的资料和最终结论分别保存。每份资料记录来源、发布时间和原文位置,每个重要结论再绑定能够支持它的具体片段。

遇到互相矛盾的资料,要先检查时间、口径和原始来源,而不是按网页数量投票。报告也应该区分已经确认的事实、分析判断和尚未确认的部分。

实际实现可以使用单 Agent,也可以让多个 Agent 并行处理独立问题。但不管怎么分工,都需要控制搜索预算,并在输出前检查引用是否真的支持相应结论。

研究报告:从问题到证据

知识点详解:从搜索结果到可信报告,中间还差什么?

先把“研究什么”说具体

假设用户问:“帮我判断甲公司最近两年的海外业务有没有增长。”

直接搜索“甲公司海外业务增长”,很容易找到新闻稿,却不一定知道增长是收入增长、订单增长,还是新增了几个办事处。

因此,任务开始时应该明确对象、时间与指标。如果用户没有指定口径,可以说明本次先以公开披露的海外收入为主,不能偷偷把“海外曝光增加”换成“收入增加”。

后续问题也就自然出现了:两年的数据在哪里?币种和统计口径一样吗?有没有重述或业务出售?这些问题共同服务于一个判断,而不是为了展示 Agent 很忙不断扩展主题。

搜索计划可以变,研究目标不能悄悄变

第一次搜索找到年度报告,却只披露了地区收入,没有直接叫“海外业务”的字段。Agent 可以改用地区名称继续查,也可以查上一年的报告核对口径。

这就是多轮研究的意义:当前证据暴露了缺口,下一轮才有新的目标。

任务状态可以记录“已找到今年数据,尚缺去年同口径数据”。取到一篇报道以后,先判断它补上了什么,而不是把整篇文字丢进上下文就继续搜索。

Anthropic 的研究系统说明展示了多 Agent 并行研究、协调和评测的一种实现。下面的证据登记方式是本文给出的工程方案,不是要求复刻该产品。

引用需要绑定到具体结论

一份最小证据记录可以包含这些字段:

字段保存什么为什么需要
source_id内部资料标识报告引用能找到原记录
url、标题资料出处用户可以回看原文
发布日期、获取日期内容何时产生、何时取得区分旧消息和新资料
原文片段、页码或章节支持判断的位置检查是否真的说过
claim_id支持哪条结论避免引用与结论错位

例如,“甲公司海外收入同比增长”,应该对应两年的同口径数据及计算依据。新闻稿只说“加快全球化布局”,就不能用来支持这个收入结论。

搜索摘要也不能替代已读原文。摘要可能被截断,缺少条件,甚至与网页后来更新的内容不同。没有读到支持结论的部分,就应该把这条判断标为待核实。

网址真实,不代表引用成立

多个链接,可能只有一个消息源

假设三家媒体都引用同一份公司公告,它们能帮助找到资料,但不能算三份独立确认。

因此,研究系统要追踪信息最初来自哪里。公司披露、监管文件、采访和转载的证据性质不同;来源是否适合,还要看当前结论是在问什么。公司官网适合确认公司宣布了什么,不必然能独立证明产品实际效果。

遇到数值冲突,也不要直接取最新或平均值。先检查报告期间、币种、统计范围与是否经过更正。如果仍然无法解释,报告保留分歧,比选一个看起来顺眼的数字更可靠。

三篇转载,可能只有一个消息源

什么时候可以结束研究?

可以把结束条件设为:关键问题有足够的有效证据,重要冲突已解释,剩余缺口不会改变主结论。也要有搜索次数、时间和费用上限。

到了预算上限仍然缺少去年数据,就输出“目前无法确认增长”,并列出缺少什么。不应该为了交付一份完整报告,补出一个不存在的数据。

评测时,分别检查结论是否正确、证据是否支持、关键方面是否遗漏。还可以故意加入转载消息、过时数据和“真实链接但不支持结论”的样本,检查系统能不能识别。

面试官继续追问

一定要多 Agent 吗?

不一定。独立子问题较多时,并行研究可能减少等待;问题很小、资料强相关时,分工会增加协调与去重成本。先让单条研究流程能够保留证据,再决定是否并行。

模型能不能自动确认所有引用?

可以辅助检查,但不能只让它回答“引用没问题”。更具体的检查是:原文片段是否存在,结论有没有超出片段范围,数值与单位是否对应。高风险结论还需要人工审核。

网页里的指令会不会影响 Agent?

会构成风险。网页是研究资料,不是执行授权。工具权限与研究边界要由应用检查,不能因为网页要求下载程序或上传资料就执行。

面试速记卡

  • 研究目标:明确对象、时间和指标,再拆分问题。
  • 动态搜索:围绕证据缺口继续查,不无目的扩展。
  • 引用可靠:结论绑定原文片段,不只附上一个网址。
  • 来源判断:转载数量不等于独立证据数量。
  • 结束条件:覆盖关键问题,解释冲突;证据不足就保留不确定性。
简历汪永久免费在线制作简历,模板直接套用、导出无水印,永久免费、下载免费,不需要付费解锁任何功能。去写简历