尧图精选

Qwen-Agent:3行代码跑通千份文档的批量问答

🕒 发布时间:2026/9/10 16:11:26 📁 来源:尧图网络
Qwen-Agent3行代码跑通千份文档的批量问答【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-AgentQwen-Agent 的 ParallelDocQA 支持对成百上千份 PDF、Word、PPT 做并行文档问答并行解析、过滤无效结果再用 RAG 召回原文汇总作答。适合需要从大量文档中一次性提取信息的研究者和数据分析人员。核心能力速览批量文档输入支持 PDF、Word、PPT、TXT、HTML、CSV、Excel 共 9 类文件并行分块问答每个文件被拆成块每块作为一个任务并行调用模型文档再多也不用整体塞进上下文无效响应过滤答不出的块会被识别为none并剔除不污染最终答案RAG 二次召回根据中间答案回到原文检索相关内容再交给摘要 Agent 生成最终回答双入口代码 API 和 Web 图形界面都能用它是怎么工作的并行文档问答流程整套流程分五步串起来就是一条分块 → 并行 → 过滤 → 召回 → 摘要的流水线。先说怎么做的。文件先经DocParser解析并切块三个关键常量定义在qwen_agent/agents/doc_qa/parallel_doc_qa.py顶部PARALLEL_CHUNK_SIZE 1000 # 并行分块大小 MAX_RAG_TOKEN_SIZE 4500 # RAG召回最大token数 RAG_CHUNK_SIZE 300 # 检索块大小每个块生成一个成员任务由qwen_agent/utils/parallel_executor.py里的parallel_exec提交到线程池执行调用间隔带 0.5 秒以内的随机延迟避免请求同时打到模型服务。每个成员只回答自己那块内容答不出来就返回{res: none}被过滤掉。再看效果如何。拿到所有有效中间答案后系统把用户问题加中间答案交给关键词生成器再用关键词检索回原文上限 4500 token最后由摘要 Agent 基于召回的原文产出最终答案。README 中提到这套方案在涉及 100 万 token 上下文的单针查询压力测试中表现完美据项目文档描述它在两个基准上超越了原生长上下文模型。跑通最小示例先装包需要 rag 和 gui 扩展pip install -U qwen-agent[rag,gui]最小可运行代码如下file字段换成你本地的文档路径即可from qwen_agent.agents.doc_qa import ParallelDocQA bot ParallelDocQA(llm{model: qwen2.5-72b-instruct}) messages [{ role: user, content: [ {text: 介绍实验方法}, {file: papers/attention.pdf}, ] }] for rsp in bot.run(messages): print(回答:, rsp)这段代码做的事情很直白创建一个并行文档问答 Agent把介绍实验方法这个问题和一份 PDF 一起交给它然后逐条打印流式返回的答案。运行前记得设置环境变量DASHSCOPE_API_KEY否则无法调用模型。不想写代码的话示例examples/parallel_doc_qa.py自带app_gui()直接运行该文件就能打开 Web 界面上传文件、输入问题即可。跑通之后你可以把file换成多个文件或目录下的文件问题从单点提取改成对比所有文档的 XXAgent 会自动完成分块和汇总。调这3个参数效果不同对结果影响最大的是分块和召回相关的三个常量都在qwen_agent/agents/doc_qa/parallel_doc_qa.py顶部改起来是几行的事参数默认值调整建议适用场景PARALLEL_CHUNK_SIZE1000块太小导致单块信息不完整时调大论文、报告等长文档MAX_RAG_TOKEN_SIZE4500召回内容不够全面时调大需要跨章节总结的问题RAG_CHUNK_SIZE300需要更大检索上下文时调大技术文档的细粒度定位稳定性方面不用操心MAX_NO_RESPONSE_RETRY默认为 4当所有并行块都回答无法回答时会自动整体重试最多 4 轮。网络不稳或模型偶发无响应时这个机制会自动兜底。谁在用、用来干嘛刚做完文献调研的研究生手里有 100 多篇论文的 PDF需要统一提取实验设置和超参数。把文件批量交给 ParallelDocQA 提问一次拿到汇总后的答案不用再逐篇翻。据 README 描述这类超长文档问答方案在基准测试中优于原生长上下文模型且更省资源。运营分析师面对成堆的用户反馈 PDF、Excel 时也可以按类别提问让 Agent 统一归类汇总。没有现成数据的场景实际体验以是否省去人工翻查为准定性上就是省时间。收束ParallelDocQA 把海量文档拆成批量分块任务再靠 RAG 把答案拉回原文回答可聚合、可追溯。文档qwen-agent-docs/website/content/en/guide/core_moduls/agent.md示例examples/parallel_doc_qa.py核心实现qwen_agent/agents/doc_qa/parallel_doc_qa.py【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →