• 请不要在回答技术问题时复制粘贴 AI 生成的内容
baicai321
V2EX  ›  程序员

有一说一, DeepSeek V4.1 跑分还行,但实测还是和 Astra 有巨大差距

  •  
  •   baicai321 · 16h 5m ago · 3408 views

    今天用了下 DeepSeek V4.1 Flash ,快是真 TM 的快,一直稳定接近 300tok/s ,但在做复杂任务的时候,是真的蠢啊,尤其是和 Astra 比

    我今天主要是拿它们来进行一些老手游的反编译和修改(都是已下线的游戏),这个任务其实很麻烦,会遇到各种各样的难题需要模型去解决,DeepSeek 全程疯狂输出 Token ,然后遇到难题就想方案 -> 改代码 -> 问题还在 -> 换方案,一直在重复这样的循环,就 TM 跟鬼打墙一样,关键是这个逼速度还飞快,所以你就看到它疯狂的吐 Token ,疯狂的换方案,最后狂奔 40 多分钟问题没解决,完事还把之前的一个已经破解的模块改坏了

    实在受不了于是换了 Astra High ,Codex 不会展示完整的思维链,tok/s 相比于 DeepSeek 也慢不少,所以对比之下 Astra 就像一个慢吞吞的老头,不紧不慢的,但它是真的稳啊,任何问题遇到后基本两轮之内必能找到正确的方案,然后修复,同样的时间内 DeepSeek 可能已经尝试了 10 个方案了。连续几次都是这样,DeepSeek 疯狂穷举方案反复横跳最后无果,换 Astra 1-2 轮解决

    感觉高难任务上国模差距还是非常明显,虽然 Token 速度拉上来了但体验是真的差

    58 replies    2026-09-13 13:25:46 +08:00
    milkleeeeee
        1
    milkleeeeee  
       16h 0m ago   ❤️ 3
    道理我都懂,但是这俩模型价格差了几十倍是怎么能拿来进行比较的
    royzxq
        2
    royzxq  
       15h 50m ago
    道理我都懂,但您不看看 ds v4.1 什么价格,astra 什么价格?
    baicai321
        3
    baicai321  
    OP
       15h 49m ago   ❤️ 6
    @milkleeeeee 问题就是,我事后算了下,在这个任务,两者的花费并没有差几十倍,可以说一个数量级,DeepSeek 跑了一个小时没有解决,API 花了 15 块,Astra 用了 3%的周额度,相当于 3 美刀,20 块钱
    sampeng
        4
    sampeng  
       15h 48m ago via iPhone   ❤️ 1
    国产模型现在就是一个主打疯狂思考,然后啥又没干
    baicai321
        5
    baicai321  
    OP
       15h 42m ago
    @baicai321 算错了,100 美刀是月付,3%周额度还没有 3 美刀,这么看 Astra 其实更便宜。。。
    milkleeeeee
        6
    milkleeeeee  
       15h 39m ago   ❤️ 1
    @baicai321 你这就好比拿刚毕业的大学生和已经有 10 年工作经验的资深工程师做对比,大学生要花一个月还做不好,花费一个月工资 3000 ,然后你 1500 外包给资深工程师他做的又快又好。于是你得出结论:大学生和资深工程师有巨大差距
    fighterhit
        7
    fighterhit  
       15h 30m ago   ❤️ 1
    你多教教 ds 嘛
    mushuanl
        8
    mushuanl  
       15h 30m ago
    但是 deepseek 还是能干活,特别是 gpt 额度不够的时候。
    还有一点是 gpt 怀疑在套代码和思路,我一次下午发现用了十几个 G 流量,联系到最近一直又是额度复位又是 pro 限制等等,就是鼓励大家多用不同想法的人用,这跟以前一直先搞一波营销,然后动不动降智很不一样。

    怀疑他们的模型能够抽取大家思维,或是他们的记忆模块有了新进步,可以快速检索记忆。或是根据这些信息进行下一步训练。
    icyalala
        9
    icyalala  
       15h 24m ago   ❤️ 4
    @milkleeeeee 那这结论没错啊...
    tgfbeta
        10
    tgfbeta  
       15h 20m ago
    就是贝吉塔和孙悟空啊
    zed1018
        11
    zed1018  
       15h 19m ago
    @milkleeeeee #5 那这结论哪里错了呢?
    413420
        12
    413420  
       15h 18m ago
    @milkleeeeee 有...什么问题?不知道在激动什么
    ybybwdwd
        13
    ybybwdwd  
       15h 14m ago
    你拿一个 500 多 B 的模型和不知道几个 t 的模型比啥。。。
    jacketma
        14
    jacketma  
       15h 11m ago
    中学生做高数,题没看懂,打字快没有用啊
    extrem
        15
    extrem  
       15h 8m ago
    特别复杂的,特别需要自主探索,多步推理的这种涉及多个目标任务是不能放任小模型去做的,多步骤执行时他会陷入局部最优盆地里去

    但是如果你给出足够的信息,定向完成某个具体任务那么他就能做的很好,其实大部分场景也就是这样

    如果真的遇到特别复杂场景,使用小模型的方式应该是自己手动规划任务,引导其执行
    milkleeeeee
        16
    milkleeeeee  
       15h 7m ago   ❤️ 1
    @icyalala
    @zed1018 结论是没错啊,但“大学生跟资深工程师有巨大差距”这个结论很显而易见,这两者压根就没有可比性

    @413420 我没激动啊,倒是你是不是 ai 用多了已经丧失基本的判断能力了
    JasonYip
        17
    JasonYip  
       15h 5m ago   ❤️ 1
    v4.1 flash 最大就 A16B ,指望不了做什么特别难的任务。最强模型出 spec ,ds 来执行就没得问题
    413420
        18
    413420  
       14h 55m ago
    @milkleeeeee 看你一个人在那诡辩
    milkleeeeee
        19
    milkleeeeee  
       14h 49m ago
    @413420 连讨论和诡辩都分不清楚,你估计就是那种 ai 说啥都同意的
    himawari8
        20
    himawari8  
       14h 46m ago   ❤️ 1
    @sampeng 这不就够了?市场策略没有毛病

    面向国内消费者,只需要:
    - 质量怎么样其实不重要,关键是定价要便宜,便宜,还是便宜;
    - 要在容易看见/感受的地方,把所有的功能塞满。满足消费者的获得感和实惠感,以给足“捡了大便宜”的情绪价值。
    webcape233
        21
    webcape233  
       14h 44m ago via iPhone
    api 价格和套餐价格,其实比不合适。主要是 ds 也不出套餐
    SanjinGG
        22
    SanjinGG  
       14h 37m ago
    @milkleeeeee #16 好像挺有可比性的吧,现在主流不就是找 3 年左右经验的+AI 代替 5 年+的人嘛
    qqlax
        23
    qqlax  
       14h 33m ago
    高中生怎么跟博士生比... ds 快就是好,处理小问题,-p 回复其实就挺好
    noahhhh
        24
    noahhhh  
       14h 29m ago
    国产模型逆向用下来只有 Kimi K3 感觉最强,我让它把好些 macOS 现在不支持的 Intel 32 游戏逆向修改支持了 Arm 64 。

    Flash 模型干点简单活还行,复杂的就很吃力了,像信创 Linux ,ARM 处理器用了远古内核史前 Glibc 魔改 Wayland ,让 GLM 5.3 Flash 装个浏览器都费劲,让 Astra 弄不仅装好还帮 XWayland 缩放 bug 和 GPU 加速搞定了。
    659746321
        25
    659746321  
       14h 26m ago
    astra high 给一个功能写的我目前 95%一以上都是一遍过,如果没过基本是我没说清楚,然后 claude 审核代码修改后。我是查不出漏洞。
    noahhhh
        26
    noahhhh  
       14h 17m ago
    @icyalala 这不一样呀,我让模型用正则匹配快速复制 NAS 文件到本地,小模型直接多线程开干了,之前用 GPT Sol 来干,我出门一趟回去还卡在生成校验 MD5 。
    gloeaerris
        27
    gloeaerris  
       13h 52m ago
    claude opus + medium 有同样的问题,总是觉得这样做就可以,然后没解决问题又说自己是推测的,下次继续犯错,思考等级提高只是减少次数,问题该有还是有,gpt 从 5.5 一直用到现在,纠正了一段时间后就不再犯这种错误,估计积累了不少记忆,token 消耗明显快得多,我觉得对比一定要用干净的独立环境处理同样的任务,不然就不公平。社区里很明显:一直用 gpt 的人改用 claude 就觉得 claude 不太行,一直用 claude 的改用 gpt 也会觉得 gpt 蠢,不用全新环境体验肯定不一样
    stardust21
        28
    stardust21  
       13h 52m ago
    5L 结论没错,所以没有必要去论坛发帖:“大学生看起来聪明,但是实际打交道还是和资深工程师有巨大差距”,这个不是说一个大家都知道的常识么?
    Jooooooooo
        29
    Jooooooooo  
       13h 46m ago
    很早就有讨论过,做到和 gpt/fable 一样的事情,性价比最高的还是这两家。

    其它的看起来 token 便宜,实际干活并不便宜
    yuzo555
        30
    yuzo555  
       13h 2m ago   ❤️ 1
    Codex 的订阅,尤其是 Pro 20X ,完成单个任务的单价其实很低的,他足够聪明,大部分不太复杂的任务可以一遍过,然后他还会隔几天重置一次,综合算下来,价格不一定比 DeepSeek API 贵。
    FlashEcho
        31
    FlashEcho  
       12h 14m ago
    @milkleeeeee #1 没有差这么多。普通用户使用 GPT 会使用订阅套餐的。一个 200 刀每月的 pro 20x ,每周可能能跑出接近 2000 刀的 API 额度,至少也有 1000 多刀,相当于官方至少了进行十倍的价格补贴。如果只用 API 价格算,确实差了几十倍。如果拿 Deepseek API 和 ChatGPT 套餐比,价格最多差几倍
    phrack
        32
    phrack  
       12h 11m ago
    大部分项目 deepseek 足够了

    问题是它太贵了,两大 AI 的订阅性价比真的甩一条街,少有的能薅到资本家羊毛的时候
    tomchen
        33
    tomchen  
       10h 37m ago
    reverse engineer 你还敢拿 deepseek 。Opus/Sol 我都不敢

    deepseek 要和 luna 比啊。不知道涨价后的 deepseek 和 codex x20 里的 luna ,谁性价比更高。我怀疑是 luna
    msg7086
        34
    msg7086  
       8h 55m ago   ❤️ 1
    @milkleeeeee #16 显而易见?
    你 1 楼说得完全没错,我也完全同意,但就是有人觉得 ds 足够好了,可以拳打脚踢高端模型了,轻松赶超欧美了,所以才有这贴辟谣啊。要是世界都那么理想,人人都那么聪明,那还要警察做什么。

    那我也可以说你 6 楼说的也是废话,楼主说的就是大学生和资深工程师有巨大差距,显而易见的大家都知道,你还特地原地 TP 解释一遍是撑的吗。怎么样,听着舒服吗?不舒服的话下次就少怼人。己所不欲勿施于人。
    msg7086
        35
    msg7086  
       8h 45m ago
    @FlashEcho #31
    OpenAI 的策略就是企业付高价补贴普通用户的低价订阅。当然政策和一般的家用服务政策是类似的,比如家庭宽带就是以用不完来计费的,而机房宽带则要考虑跑满的量来计费,同样 1G 的宽带,家用一个月跑 1T 流量算高的了,而机房则要考虑你一个月跑 100T 甚至 300T 来计费。
    所以就是先开放便宜的订阅给你用,反正大多数人用不完(因为 ToS 规定严禁一个账户多人共享),等你用爽了,向公司推荐,让公司接入正规 API 接口,走企业定价,这样才挣大钱回血。个人订阅现在相当于打了 0.4 折,200 刀订阅一个月能跑 5000 的 Astra 。

    不过归根结底有些任务还是要靠模型能力硬抗,要不然 Astra 两轮干完了 DS 干到下辈子都干不完。之前用哈基米 3.X Flash 跑复杂的逆向项目也是,输出速度刷刷的,跑起来一看什么鸟东西,烧完了几百条请求也没把地基搭完。
    darson
        36
    darson  
       7h 32m ago via iPhone
    deepseek 的论文里面清楚的指出,虽然 benchmark 接近,但长任务,复杂任务的差距明显。deepseek 向来坦诚,从没说过不切实际的宣传语。是某些人太想赢了。
    win8en
        37
    win8en  
       6h 55m ago via Android
    道理我不懂,如果 4.1 flash 真能能 GPT6 接近的话,价格不可能差距这么多了
    Ley
        38
    Ley  
       6h 12m ago
    其实 OP 的重点想说的可能是“跑分很高但是实际编程性能和类似跑分的 Codex 相比有预期外的落差”吧
    这里价格其实不是主要问题,而是低价高分但没有高能
    sampeng
        39
    sampeng  
       5h 55m ago via iPhone   ❤️ 2
    不知道在争论的有没有拿 ds 干活,这周国内的我都试过。财新的报道我也看过,一点毛病没有。单位 token 便宜是没错,但真的综合成本贵的 1p 。有进步没错,但人民群众的钱也不是大风刮来的。花了钱就要解决问题。op 这个例子不好,op 应该和 luna max 比…luna max 才是属于不要钱的那一档。我实际体验毛都摸不到。虽然都慢,但 luna max 是都能解决绝大部分问题。

    我尝试了两次,我以为是 ds 我没用对,我把步骤,原因,用 astra 整理好,他又在那暴力思考半小时半天憋出来修改两文件两三行…

    就这个表现,再便宜十倍我都用不上,太慢了就成了我为啥不自己上?为啥我一定要坑次坑次

    真没好争论的,有些人在意单位 token ,有些人在意综合成本。只能说各取所需。

    当然还有一类情怀人,国模要崛起了,支持国货就是政治正确。那我只能说尊重他人命运吧…
    yidinghe
        40
    yidinghe  
    PRO
       5h 23m ago via Android
    显然美国这边已经掌握了反蒸馏的新方式,就是让思维链在模型内部滚动不输出,你不管怎么蒸馏,都填不满输入跟输出之间的巨大鸿沟。这也是为什么 A\ 曝光的蒸馏提示词经过精心设计,绞尽脑汁要求模型给出完整思维链。
    thatlazyman
        41
    thatlazyman  
       5h 5m ago
    v4.1F 快但别问对不对,只保证快了,适合对速度必要有要求任务,比如实时翻译。 距离新出的 astra 差距明显
    jenson47
        42
    jenson47  
       5h 1m ago
    我觉得应该是语料不足也有关
    milkleeeeee
        43
    milkleeeeee  
       4h 57m ago
    @msg7086 你是对的
    catazshadow
        44
    catazshadow  
       4h 45m ago via Android
    @jenson47 压制言论表达,出版自由,导致语料不足

    一环扣一环,全是自找的
    testsb
        45
    testsb  
       4h 37m ago
    跑分对标的是 sol 吧,sol 跟 astra 差距本身也不算小
    lujiaosama
        46
    lujiaosama  
       4h 27m ago
    @sampeng DS 拿来解决简单任务还是可以的,没有那么不堪。复杂任务自然需要 GPT6, GPT 5.6 SOL 这档。
    jackerbauer
        47
    jackerbauer  
       4h 26m ago
    有一说一,已经能满足我大部分的编码工作了
    uplee
        48
    uplee  
       4h 4m ago
    @baicai321 API 肯定没法跟 coding plan 比的,你要算上 tibo 的重置,更便宜
    0x0x
        49
    0x0x  
       4h 2m ago via Android
    结论没错,基于 6 楼的结论:大学生和资深工程师之前差距巨大,但是有些公司的活可能只需要大学生就够了,并不是所有的工作都需要资深工程师来做。

    大学生有大学生存在的价值,而且大学生也可以成长为资深工程师,给 ds 一些时间
    mingff258
        50
    mingff258  
       3h 59m ago
    优势是快,非常快,我的任务相对简单,语义分析提取一些信息,相同任务我试过 GLM-5.3-flash 、qwen-3.8-flash 、mimo-2.5-pro ,出完整结果能快 3 倍以上甚至 5 、6 倍,而且做得更好。真 FLASH !
    fanfou
        51
    fanfou  
       3h 59m ago   ❤️ 1
    ds 真没有那么便宜, 从开发交付结果上来说。gpt 不需要几轮就能解决问题, 而 ds 需要花很多轮,中间可能还需要人来纠偏。输出 token 是快, 但是不出活有什么用。看最终任务完成度,烧的 token 和 gpt 不是一个数量级。
    zhanying
        52
    zhanying  
       3h 33m ago
    能有 sol 就不错了。。
    daliusu
        53
    daliusu  
       3h 19m ago
    这个模型完全不行啊我测试,为啥你们能拿他和 astra 比啊,我觉得也就是 luna 那一档的,比 sol 都差远了,我让他整理项目文档和实际开发功能,感觉都达不到可用标准,总有各种遗漏和理解不足的地方,出来的功能明显不如 grok4.6 (我觉得这个就是可用线了),但是速度确实快
    daliusu
        54
    daliusu  
       3h 16m ago
    @daliusu #53 然后算算实际使用的价钱,感觉还不如 luna 开最高思考和快速,虽然还是慢一点,但是算下来加上重置便宜很多
    tianjiyao
        55
    tianjiyao  
       2h 59m ago
    本来就是个电动自行车。。只不过现在是高档一些的电动自行车,你拿来和汽车比。。。我只觉得好笑。。
    lsylsy2
        56
    lsylsy2  
       2h 55m ago
    我拿来一轮任务写几千行的代码调用几十个工具,我也用 astra ,flash 干这种活玩不来
    但是我每个小时跑一次,去抓一下网页更新然后理解一下内容总结给我的小任务,ds 跑完了 astra 可能还在猛猛加载,这种活为什么不用 ds 呢
    jetsung
        57
    jetsung  
       48 mins ago
    它适合跑那些长任务类型的,能理解和执行就行了。人是逻辑思维什么的,像一些大佬说的,用 A\ 和 OpenAI 的模型来跑规划。
    Rorysky
        58
    Rorysky  
       43 mins ago
    目前模型领域算是充分竞争的环境,这个环境下不存在 下克上
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2875 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 91ms · UTC 06:08 · PVG 14:08 · LAX 23:08 · JFK 02:08
    ♥ Do have faith in what you're doing.