尧图精选

AI日报自动化实践:从信息聚合到个人知识库的工程化方法

🕒 发布时间:2026/10/1 21:58:03 📁 来源:尧图网络
1. 一份日报的诞生从信息洪流到可读清单每天早上七点我的手机屏幕上会准时弹出一份自己写的日报。它不是某个平台推送的也不是订阅的付费简报而是我用一套跑了快两年的流程自动生成、再人工过一遍的产物。2026年9月25日这一期恰好是个挺典型的样本——当天信息量不算爆炸但有几条值得展开的东西正好拿来把整套方法拆开讲清楚。先说清楚这份日报到底是什么。它是一份面向个人和小团队的AI领域信息聚合产物覆盖模型发布、工具更新、行业动态、论文速览、开源项目这几个固定板块每天控制在15到25条之间每条配一句自己的判断。它解决的问题很具体AI领域的信息密度太高光靠刷时间线你看到的永远是算法想让你看到的而不是你真正需要知道的。适合谁来参考如果你每天要花半小时以上在各类信息源之间来回切换或者你需要在团队里做技术选型、趋势判断这套东西能帮你把时间压到十分钟以内。我一开始也是手动整理的。打开十几个标签页一条条看复制粘贴到文档里再排版。坚持了大概三周就崩了——不是没时间是重复劳动带来的注意力损耗太严重。真正有价值的判断比如这条更新对我们正在做的项目意味着什么往往在机械操作里被磨没了。后来我才想明白日报的核心价值不在于收集而在于筛选和判断。收集这件事应该交给机器人只负责最后那道判断。所以整套流程的设计原则就一条机器做聚合和初筛人做判断和定稿。听起来简单但中间的分寸很难拿捏。机器筛得太狠会漏掉一些当时看着不起眼、事后很重要的东西筛得太松人还是要面对一堆噪音。我调了大概两个月才找到一个相对舒服的平衡点后面会详细讲这个阈值是怎么定的。这一期日报的生成过程正好可以当作一个完整的案例。当天我关注的几个方向都有动静一个开源推理框架发了新版本一个多模态模型更新了权重还有两篇论文的结论跟主流认知有点出入。这些东西单独看都是碎片但放在一起能拼出一个关于推理效率的小趋势。日报的价值就在这儿——它不只是信息的堆叠而是把碎片拼成一张能看懂的地图。2. 信息源的取舍为什么我砍掉了八成订阅2.1 从越多越好到少而准的转变刚开始做日报的时候我有个很天真的想法信息源越多覆盖越全。于是 RSS 订阅列表一度膨胀到一百多个推特关注了四百多人还加了十几个群。结果就是每天打开阅读器未读数四位数起步光扫标题就要二十分钟。更糟糕的是信息源之间大量重复同一条模型发布的消息能在七八个渠道里看到只是措辞不同。后来我做了一次彻底的清理标准很简单这个源在过去一个月里有没有提供过一条我最终写进日报的信息没有的直接砍。这一刀下去订阅从一百多降到二十出头。推特关注也做了类似处理只留下那些首发信息多、转述少的账号。群聊基本全退了只留两个真正有讨论质量的。这个清理过程让我意识到一件事信息源的价值不在于数量而在于信噪比和首发率。一个每天发五十条但全是转述的账号价值远不如一个每周只发三条但都是首发的账号。前者消耗你的注意力后者节省你的时间。2.2 我最终保留的几类信息源现在我的信息源分成四类每类的作用不一样官方渠道模型和工具的官方博客、更新日志、GitHub Release。这类源的特点是准确、权威但更新频率低而且往往只讲自己不讲上下文。它们是日报的骨架但不能只靠它们。聚合型社区一些技术社区的热榜和讨论区。这类源的价值在于筛选已经发生了一轮——能上热榜的至少说明有一批人觉得重要。但要注意热榜反映的是讨论热度不等于实际价值有些纯话题性的东西热度很高但没什么用。个人博主和研究者我留了大概十几个都是长期跟踪下来觉得判断靠谱的。这类源的价值在于观点和解读他们往往能看出官方公告里没明说的东西。但个人博主的观点有偏向性需要交叉验证。论文预印本平台这个不用多说做技术跟踪的都知道。但预印本质量参差不齐我的做法是只看有代码放出的和引用数在短期内快速上升的能过滤掉大部分水文。这四类源在日报里的分工很明确官方渠道提供事实聚合社区提供热度参考个人博主提供解读视角论文平台提供前沿信号。缺了哪一类日报都会显得单薄。2.3 一个容易被忽略的细节时间窗口信息源定了之后还有个时间窗口的问题。我试过几种方案实时抓取、每小时抓一次、每天固定时间抓一次。最后选的是每天早上六点抓过去二十四小时的内容。为什么不是实时因为实时抓取会带来一个心理问题你会忍不住一直去看注意力被切得很碎。而且很多信息在发布后的几个小时内会有反复修正实时抓到的可能是错的。等二十四小时信息基本沉淀下来了准确性高很多。为什么是二十四小时而不是更长因为AI领域的信息半衰期很短超过四十八小时的东西要么已经被广泛讨论过了要么已经不重要了。日报的定位是当天值得知道的事不是本周回顾。提示时间窗口的选择没有标准答案取决于你的使用场景。如果你需要做实时决策窗口要短如果你是做趋势跟踪窗口可以长一些。关键是固定下来不要今天抓二十四小时明天抓一周那样日报的节奏会乱。3. 自动聚合的工程实现从抓取到初筛3.1 抓取层稳定比快更重要抓取这部分我用的是最朴素的方案Python 脚本加定时任务。没有上什么复杂的框架因为这个场景对实时性要求不高对稳定性要求很高。每天早上六点跑一次跑挂了要有告警跑成功了要有日志。抓取的核心难点不在技术在反爬和格式适配。每个源的页面结构都不一样有的提供 RSS有的只有 HTML有的有 API 但限流。我的做法是给每个源写一个独立的适配器输出统一的数据结构{ source: source_name, title: 条目标题, url: 原始链接, published: 2026-09-25T03:20:00Z, summary: 原始摘要或正文前200字, raw_content: 完整正文如果有 }这个结构看着简单但字段的设计有讲究。published用 UTC 时间避免时区混乱summary和raw_content分开存因为初筛阶段只需要 summary定稿阶段才可能需要全文source字段保留是为了后面做权重计算。适配器写起来很枯燥但有个技巧能省不少事先看这个源有没有现成的 RSS 或 API。有的话直接用别去解析 HTML。RSS 虽然老但胜在稳定而且格式统一。我现在的源里大概六成有 RSS三成有 API只有一成需要解析 HTML。那一成是最容易出问题的页面一改版就挂所以我会给它们加更频繁的健康检查。3.2 初筛层怎么让机器判断这条值不值得看抓取只是把信息拿回来真正的难点是初筛。一百条原始信息里可能只有二十条值得进日报。让机器来判断哪二十条这件事我踩过不少坑。最早我用的是关键词匹配设了一堆词表命中就保留。结果很糟糕关键词匹配没有上下文模型这个词在一条讲模型压缩的论文里和在一条讲模型发布会的新闻里重要性完全不同。而且词表维护起来很累新概念层出不穷你永远在补词。后来换成了基于来源权重加互动量的简单打分。每个源有个基础分官方渠道高一些个人博主低一些然后看这条信息在源内的互动情况比如 GitHub 的 star 增速、社区的评论数、推特的转发量。两项加权取 top N。这个方案比关键词好但有个明显缺陷它偏向已经火了的东西。有些重要的更新发布初期没什么互动等互动起来已经是第二天了。日报如果只追热点就会变成昨日热点汇总失去了前瞻性。现在的方案是混合的来源权重占六成互动量占三成剩下一成留给异常信号。所谓异常信号是指那些跟当天其他信息明显不同类的东西。比如某天大部分信息都是模型发布突然出现一条讲硬件的那这条就会被加权。这个逻辑很简单但效果不错能捞到一些被热度掩盖的东西。3.3 去重比想象中麻烦去重这件事我一开始觉得很简单标题相似度算一下就行了。实际做起来才发现坑很多。同一个事件不同源的标题可能完全不一样。比如一个模型发布官方标题是Introducing Model X科技媒体的标题是XX公司发布新一代模型性能提升40%社区讨论的标题可能是有人试了 Model X 吗。这三个标题的字面相似度很低但说的是同一件事。我试过几种方案编辑距离、Jaccard 相似度、TF-IDF 余弦相似度。效果最好的是基于 URL 和实体抽取的组合。URL 去重能解决同一篇文章被多个聚合源转载的情况实体抽取能识别出标题里的模型名、公司名、人名实体重合度高的就归为一组。实体抽取我用的是一个轻量的 NER 模型本地跑不依赖外部服务。准确率大概八成多剩下的靠人工在定稿时补。这个准确率够用了因为去重不是要求百分之百漏掉几条重复的比错杀几条不重复的代价小得多。注意去重的时候一定要保留最早发布的那条作为主条目其他作为关联链接。因为最早发布的往往是首发源信息最准确后续转载可能会有添油加醋。4. 人工定稿日报真正的价值所在4.1 为什么机器不能完全替代人前面说了那么多自动化但日报真正的价值恰恰在机器做不了的那部分。机器能告诉你发生了什么但告诉不了你这意味着什么。而后者才是读者真正需要的。我每天花在定稿上的时间大概是二十分钟到半小时。流程是打开初筛后的列表从头到尾过一遍对每条做三件事——判断重要性、补充上下文、写一句自己的话。判断重要性这件事机器很难做好因为它需要结合你当前在做的事情。同样一条模型更新对一个做推理优化的人来说是大事对一个做数据标注的人来说可能无关紧要。这个上下文只有你自己知道。补充上下文也是机器做不好的。一条官方公告往往只讲结果不讲背景读者如果不知道前因后果很难判断这条信息的价值。比如某框架新版本推理速度提升30%这个30%是相对于哪个版本在什么硬件上测的跟同类框架比是什么水平这些都需要人去补。写一句自己的话这是日报的灵魂。可以是判断可以是疑问可以是联想。比如这个更新对我们正在做的XX项目可能有影响下周试试或者这个结论跟之前那篇论文矛盾需要再看看。这句话是给未来的自己看的过一段时间回头看能快速回忆起当时的思考。4.2 定稿时的几个判断标准过了这么久我慢慢总结出几条判断标准用来决定一条信息是进日报、进简讯还是直接扔掉判断维度进日报详细进简讯一句话扔掉与当前项目相关性直接相关间接相关无关信息确定性官方确认多方传闻单一来源影响范围可能改变技术选型值得知道纯话题时效性当天必须知道本周知道就行随时可查这个表不是死的实际判断时会有很多模糊地带。但有了这个框架至少能保证判断的一致性——不会今天觉得重要的东西明天觉得不重要导致日报质量忽高忽低。还有一点很重要日报要有取舍不能什么都往里塞。我见过一些日报一天几十条看着很全但读者根本看不完。我的做法是硬性控制在25条以内超了就砍砍的时候优先砍那些知道了也没什么用的。这个没什么用的判断很主观但正是这种主观判断构成了日报的个性。4.3 2026年9月25日这一期的具体处理拿这一期举例。当天初筛后剩下三十多条我过了一遍最后留了18条。砍掉的里面有几条是重复的有几条是纯产品营销没什么信息量的还有两条是当时看着热闹但跟我的关注方向无关的。留下的18条里有3条我做了详细展开。一条是某个开源推理框架的新版本因为它改动了调度策略可能影响我们正在做的部署方案一条是多模态模型的权重更新因为更新说明里提到训练数据有调整这可能会影响下游任务的表現还有一条是一篇关于长上下文效率的论文结论跟之前的认知有出入值得记一笔。每条我都写了一句话的判断。框架那条我写的是调度策略从静态改成动态理论上对突发负载更友好但要看实际压测数据下周找时间试试。模型那条写的是训练数据调整了微调的时候要注意分布偏移可能需要重新采样。论文那条写的是结论说长上下文的效率瓶颈不在注意力计算而在KV缓存这个跟之前的认知不一样需要验证。这些话现在看着很普通但过一个月回头看能快速回忆起当时的判断依据。日报的价值会随时间累积单看一天没什么看一个月就能看出趋势看一年就能看出自己的认知变化。5. 日报的呈现与分发怎么让未来的自己愿意看5.1 格式的选择Markdown 加静态页面日报的呈现格式我试过不少。最早是纯文本后来用过 Notion再后来试过各种笔记软件。最后回到最简单的方案Markdown 文件加一个静态页面生成器。为什么是 Markdown因为它纯文本、可版本控制、不依赖任何平台。我用 Git 管理所有日报每天一个文件按日期命名。这样有个好处可以随时 diff看某一天跟另一天有什么变化也可以全文搜索找某个话题是什么时候第一次出现的。静态页面生成器我用的是最轻量的那种把 Markdown 转成 HTML加一个简单的索引页。整个站点是纯静态的放在本地或者随便什么能放静态文件的地方都行。没有数据库没有后端维护成本几乎为零。这个方案看着很土但胜在可靠。我试过的一些花哨方案要么依赖某个服务的免费额度要么格式不开放用着用着就出问题。日报是个长期的事工具越简单越能坚持。5.2 分发只给需要的人看日报做出来给谁看我一开始想的是公开分享后来发现公开分享有个问题你会不自觉地为了读者而写而不是为了自己。为了读者你会倾向于选那些看起来重要的东西而不是对你重要的东西。时间长了日报就变味了。现在的做法是主要给自己看小范围分享给几个同事。分享的方式也很简单就是把静态页面的链接发过去。没有订阅系统没有推送想看的人自己去看。这个方式很被动但反而筛出了真正需要的人——那些会主动去看的才是真的需要。偶尔会有同事反馈说某条信息很有用或者某条判断他们有不同的看法。这些反馈很有价值我会记下来作为调整信息源和判断标准的参考。但不会为了迎合反馈而改变日报的定位它首先得对我自己有用。5.3 归档与检索让日报变成知识库日报做久了最大的价值其实不在当天而在归档和检索。我现在有快两年的日报按日期排好全文可搜索。这个东西慢慢变成了一个个人知识库。比如我想查某个模型是什么时候发布的搜一下就能找到当天的日报里面有当时的判断和上下文。比如我想回顾某个技术方向的发展脉络把相关日期的日报拉出来看一遍比读任何综述都直观因为这是我自己的视角我知道当时为什么关注这个。归档还有个作用定期回顾。我每个月会花半小时翻一遍这个月的日报看看哪些判断对了哪些错了。对了的总结一下判断依据是什么错了的想想当时忽略了什么。这个习惯坚持下来对判断力的提升比读任何文章都管用。提示归档的时候建议给每天的日报加几个标签比如涉及的技术方向、公司名、模型名。这样后面检索的时候会方便很多。标签不用太细三五个就够太细了维护成本高。6. 跑了一年多之后我的一些真实体会6.1 日报的质量取决于你的判断力不是工具工具很重要但工具解决的是效率问题解决不了判断问题。同样一套工具不同的人用做出来的日报质量天差地别。核心差异在于判断力——你能不能从一堆信息里挑出真正重要的能不能看出信息背后的趋势能不能给出有价值的判断。判断力这个东西没有捷径就是多看、多想、多验证。看多了自然有感觉想多了自然有框架验证多了自然知道自己的判断哪里容易出错。日报本身就是一个训练判断力的过程每天逼自己做一次筛选和判断时间长了进步很明显。6.2 不要追求全要追求准我见过很多人做日报追求的是覆盖面什么都要有。结果就是日报越来越长读者越来越少。信息的价值不在于多而在于准。一条准确的、有判断的信息价值超过十条泛泛而谈的。准体现在几个方面信息本身要准确不能是谣言判断要准确不能拍脑袋选择要准确要选真正重要的。这几个准里面最难的是选择。因为重要是个相对概念对你重要对别人不一定重要。所以日报一定要明确自己的定位是给谁看的关注什么方向然后围绕这个定位做选择。6.3 坚持比优化更重要做日报这件事最大的挑战不是技术是坚持。我见过太多人一开始热情很高工具搭得很漂亮做了两周就停了。原因各种各样太忙、觉得没价值、看不到反馈。我的经验是先跑起来再优化。不要一开始就追求完美先用最土的办法做做起来之后再慢慢改。我最早的日报就是手动复制粘贴的后来才慢慢加上自动抓取、初筛、去重。如果一开始就想着搭一套完美的系统可能到现在还没开始。还有就是降低单次成本。每天花在日报上的时间我控制在半小时以内。超过这个时间就很难坚持。所以自动化能解决的尽量自动化不能自动化的尽量简化。日报是长期的事可持续比完美重要。6.4 日报之外还可以做什么日报跑顺了之后我慢慢发现它还能衍生出一些别的东西。比如周度回顾把一周的日报串起来看能看出一些日报里看不出的趋势。比如专题整理某个方向积累了一段时间的日报可以整理成一篇专题文章。再比如判断复盘定期回顾之前的判断看看哪些对了哪些错了。这些东西都不是一开始就规划好的是做着做着自然长出来的。所以我的建议是先把日报本身做好别想太多。日报做扎实了后面的东西会自然出现。回到2026年9月25日这一期。它本身没什么特别的就是普通的一天普通的一份日报。但正是这些普通的日子积累起来构成了对AI领域持续跟踪的完整记录。日报的价值不在某一天而在每一天。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →