mythjava
V2EX  ›  问与答

豆包的文件解析是怎么做的, 我想仿照做一个

  •  
  •   mythjava · 13 days ago · 3605 views

    原始需求是公司员工不想读招标文件, 只想摘要出其中最关键的信息, 比如商品/数量/规整等等

    我自己用 rag 做了一下, 感觉和豆包的解析效果差远了, 我还做了很对针对性的调整

    豆包应该是一个通用的方式, 是用什么方式实现的呢, 我先要抄一下本地部署

    23 replies    2026-07-15 17:05:35 +08:00
    yongyuanfan2
        1
    yongyuanfan2  
       13 days ago   ❤️ 1
    写个文件解析的 MCP 服务,然后把文件内容读取出来塞给大模型总结,这样应该可以吧
    mythjava
        2
    mythjava  
    OP
       13 days ago
    @yongyuanfan2 把所有内容都给大模型的话 上下文不够, 只给部分的话, 不知道如何挑选哪部分
    skuuhui
        3
    skuuhui  
       13 days ago   ❤️ 1
    nothing is all 。把 ls find rg (ripgrep) grep cat/sed 工具开放给它。
    YanSeven
        4
    YanSeven  
       13 days ago via Android
    我比较好奇的是,豆包能不能做到百分百正确
    since2021
        5
    since2021  
       13 days ago
    为什么不用腾讯的 ima copilot
    peteretep
        6
    peteretep  
       13 days ago
    一边读,一般压缩啊
    peteretep
        7
    peteretep  
       13 days ago
    一边读,一边压缩啊
    Yishanshan
        8
    Yishanshan  
       13 days ago
    我看了 workbuddy 的实现,我们有个合同( 600kb )要解析并做要素提取,他好像是直接使用 python 的 pdf 工具直接分页读大概,然后让 LLM 判断如何查找的
    Yishanshan
        9
    Yishanshan  
       13 days ago   ❤️ 1
    @Yishanshan 我自己按照这个思路试了一下,的确很快很准确
    Mithril
        10
    Mithril  
       13 days ago
    比较新的模型上下文都很大,一般都够用了。

    实在不行你也可以分页扔过去总结压缩,然后拼一起做汇总。
    haah
        11
    haah  
       13 days ago
    问 chatgpt!
    haah
        12
    haah  
       13 days ago
    直接问豆包!
    imkuang
        13
    imkuang  
       13 days ago via Android
    把文件和用来查找文件的工具( grep 、sed 、find 之类的)给它让它自己找就行,ai 会自己分析了解文件结构、按关键字搜索,不用把文件一次性全部贴到上下文里
    Maboroshii
        14
    Maboroshii  
       13 days ago
    直接接入现成的 agent sdk 就行
    artiga033
        15
    artiga033  
       13 days ago via Android   ❤️ 1
    @mythjava 1M 上下文不够?那你这文件人类想读完也难吧
    IlIl
        16
    IlIl  
       13 days ago
    封装一个直接去调用豆包
    watzds
        17
    watzds  
       13 days ago
    我估计最大的优化点是不用 RAG
    mythjava
        18
    mythjava  
    OP
       13 days ago
    @artiga033 确实是这样的, 一份文件人读下来可能要好几天, 一边读一遍做笔记这样的
    mythjava
        19
    mythjava  
    OP
       13 days ago
    @watzds 我尝试一下
    mythjava
        20
    mythjava  
    OP
       13 days ago
    @IlIl 我去看一下豆包有这样的收费接口吗
    listenerri
        21
    listenerri  
       13 days ago via Android
    分段交给子代理
    WilliamColton
        22
    WilliamColton  
       12 days ago
    @mythjava #19 我感觉也是,现在代理自己用工具检索似乎比 rag 效果好很多,只是速度慢一些
    ccys
        23
    ccys  
       12 days ago   ❤️ 1
    关键信息提取,可以一页一页内容发送给 llm,然后让他进行抽取,给他规定一个 json 或者 xml 让他去填空
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   953 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 48ms · UTC 21:48 · PVG 05:48 · LAX 14:48 · JFK 17:48
    ♥ Do have faith in what you're doing.