Skip to content
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/agent-practice-10-public-info-to-excel-ABL-20260831-V1.md

AI实战10|别再手工复制网页:让Agent把公开信息直接整理成Excel

很多网络工作其实并不难。

但特别耗时间。

比如你要整理30家公司:

公司名称;

主营业务;

成立时间;

主要产品;

最新融资;

官方网站。

传统做法可能是:

打开网页;

找到信息;

复制;

切回Excel;

粘贴;

再打开下一家公司。

真正浪费时间的并不是分析。

而是:

重复搜索 + 复制粘贴。

这类任务非常适合交给Agent。

一、先确定你到底要哪些字段

批量网络采集最重要的一步不是搜索,而是:

先把最终表格的列定义好。

比如研究一批公司,可以提前定义:

公司名称;

证券代码;

主营业务;

主要产品;

收入;

实际控制人;

官方网站;

信息来源。

然后让Agent逐家公司按照同一套字段搜集。

字段不统一,最后就很难比较。

二、不要让Agent写30段公司简介

如果最终目的是比较公司,就不要让AI:

“一家公司写一段介绍。”

这样最后得到的是大量文字。

真正方便后续工作的形式应该是:

一家公司一行,一个字段一列。

这样才能:

筛选;

排序;

比较;

统计;

继续分析。

所以很多网络任务真正需要的并不是“报告”。

而是:

结构化数据。

三、最好保留每条信息的来源

比如Agent整理:

某公司2025年收入100亿元。

如果Excel里只有:

100亿元

过几天你可能已经不知道这个数字从哪里来的。

所以重要字段最好同时保存:

来源名称;

原始链接。

对于特别重要的数据,还可以保留:

报告名称;

公告日期;

页码。

这样以后发现问题,可以快速回查。

四、不同来源冲突时不要自行选一个

比如:

公司官网写员工2000人;

媒体报道写2500人;

另一个数据库又写1800人。

这时候Agent不应该随便选一个填进去。

更合理的是:

优先采用你指定的高等级来源;

如果仍然存在冲突,就标记:

“数据存在差异,待确认。”

结构化数据最怕的不是空白。

而是:

看起来完整,但数字其实是错的。

五、很适合做哪些任务?

这种方式可以用于:

上市公司资料整理;

竞争对手分析;

客户名单核查;

供应商信息整理;

产品价格比较;

招聘信息收集;

政策文件清单;

案例目录;

行业公司数据库。

律师工作里也非常常见。

比如整理IPO公司时,可以批量采集:

上市板块;

保荐机构;

律师事务所;

主营业务;

审核问询链接;

上市日期。

最后直接形成基础数据库。

六、资料量大时可以分两步

比如有100家公司。

第一步先让Agent采集基本字段,形成Excel。

第二步再让Agent根据Excel筛选:

哪些公司值得深入研究。

这样比一开始要求:

“深度研究100家公司”

更实际。

很多AI任务都可以先用低成本方式完成:

广度筛选。

再对少数重点对象做:

深度研究。

七、不要忽略“采集日期”

网络信息会变。

比如:

公司高管;

产品价格;

员工人数;

股东情况。

半年以后可能已经不同。

所以涉及动态信息时,可以在表格里增加一列:

信息采集日期。

这样以后你至少知道:

这个数字是什么时候查到的。

直接复制的实战提示词

请根据【公司/项目/产品名单或输入文件】逐项进行公开网络检索,并按照统一字段整理【字段1、字段2、字段3、字段4等】。优先使用官方网站、监管披露、正式公告等可靠来源,每条重要信息保留来源名称和原始链接;不同来源存在冲突时不要自行猜测,请标记“待确认”。最终生成【信息采集表.xlsx】,一条对象一行、一个字段一列,并增加“来源”和“采集日期”,保存至【输出文件夹】。

最后记住一句话

遇到大量网页资料时,不要再:

搜索一个,复制一个。

先定义最终需要哪些字段,

然后让Agent完成:

搜索 → 提取 → 核验 → 填表。

很多原本需要几个小时机械复制的工作,就可以直接变成一张结构化Excel。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信