• 请不要在回答技术问题时复制粘贴 AI 生成的内容
1258
V2EX  ›  程序员

qwen3.8 27B 被低估了

  •  
  •   1258 · 6h 9m ago · 2699 views
    qwen3.8 27B 完全被低估了,讨论度不高。
    如果有人在年初跟我讲,可以用两张 3090 本地部署一个超越当时最强的 opus4.5 几代的模型,我会觉得是痴人说梦。
    感觉 qwen3.8 完全可以加入穿越者套餐了,穿越之自带太阳能发电板+本地部署 qwen3.8 27B 的硬件设备,再造人类文明完全不是问题吧
    19 replies    2026-08-17 19:50:55 +08:00
    yiranw09
        1
    yiranw09  
       5h 59m ago
    你指 runinfra 免费的 qwen3.8 27B ?很奇怪的是我始终无法把他接入 hermes ,一直报错 Context length exceeded (16 tokens). Cannot compress further.
    sentinelK
        2
    sentinelK  
       5h 59m ago   ❤️ 2
    没有网络检索能力的小模型就是渣。

    小模型意味着信息量储备少,没有非常深厚的常识基础,或者说常识的抽象程度很高。
    如果没有外部信息做支撑,很容易产生很多没有细节的“正确的废话”。

    最简单的办法,你用 llama.cpp 的默认 web 应用调用一下试试看,直接就变成弱智。

    能力强的小模型很像中年老板。能量大,但其实不太关注信息量和细节。他的能力都来自于和外界的串联。你把他手机收了直接降级成中年油腻老头。

    相反,老版本的大模型像是老教授,不太会玩手机,所以显得很笨,很脱离现实。
    1258
        3
    1258  
    OP
       5h 52m ago
    @sentinelK 好比喻,也可以比喻成能力很强的年轻程序员,没有 github 或者网络检索很难凭经验解决 bug ,只能力大砖飞
    1258
        4
    1258  
    OP
       5h 51m ago
    @yiranw09 runinfra 的 3.8 居然免费了吗?这个模型部署成本确实很低
    levn
        5
    levn  
       5h 47m ago
    都吹成本地的 opus4.6 了,还叫低估吗
    1258
        6
    1258  
    OP
       5h 39m ago
    @levn 是本地百无禁忌的 opus4.6 ,这很夸张了,你甚至可以要求他做坏事,或者在灰色地带赚钱,只需要付出电费。
    nguoidiqua
        7
    nguoidiqua  
       5h 35m ago
    其实 R 站讨论热度很高的,国内玩自己部署的还是相对较少。

    单看编程方面的跑分,略超 Opus 4.6 、MiniMax M3 、Gemini 3.5 ,略低于 Hy3 、Kimi K2.6 ,稍弱于 V4 Flash 0731 、Spark 1.1 、Gemini 3.7 、GLM-5.2 、Qwen3.7 Max 。(当然跑分这个东西仅供参考,各家跑分的排名都是出入较大的)

    不过目前反馈有:一、过度推理,xHigh 下面推理消耗的时间和 TOKEN 比 Medium 多几倍。二、偏科严重,相比 Qwen3.6 27B ,某些方面提升很大,某些方面反而倒退了。
    coefu
        8
    coefu  
       5h 13m ago
    1 ,deepseek harness + qwen3.8 27B ,自己修复自己 bug ,自己给自己写插件。

    2 ,联网,记忆,都让它自己写的插件。一个联网的小 case ,都还有很多搞不定。指点一条路,searxng 。记忆参考 benchmark: https://agentmemories.ai/home

    3 ,Hidden Dimension: 5120 ,Number of Layers: 64 ,dense 黄金比例下,参数有限,只能靠反复推理榨出更多智力,过度推理是代价,但是本地部署,无非多几度电罢了,终归能把任务完成。从 Hidden Dimension: 8192
    ,Number of Layers: 92 的 2.4T 里 蒸馏出来的 逻辑能力。就这么点参数,逻辑能力占多了,通用知识当然就少了。
    coefu
        9
    coefu  
       5h 2m ago
    它的对手是 早它几天开源的 Muse-Glimmer-30B ,glimmer 确实也很 ok ,但是 Hidden dimension 6656 ,Layers 52 ,比 27B 少了 12 层深度,虽然宽了点,表达更丰富。但是,在特定的领域里,比如 coding / math ,逻辑缜密性 比 表达能力更重要。这在具体任务上,通常就是 看起来在思考,但是最深层次的矛盾,总是擦肩而过,力有不逮的感觉。

    glimmer 适合写小说,写剧本,一定深度的任务。

    qwen3.8 是 coding 领域真正的生产力工具。
    necZhang711
        10
    necZhang711  
       3h 28m ago
    @nguoidiqua 求问,r 站是啥子
    zhuantouer
        11
    zhuantouer  
       3h 11m ago
    x 上讨论挺多的,看老外的评价口碑还可以

    m4 pro 试了下,10t/s 左右,的确思考过度,蹲一下他们的 moe a3b 的模型
    1258
        12
    1258  
    OP
       2h 56m ago
    @coefu 666 大佬好专业的回答,自托管生产力我觉得是里程碑,毕竟电费直接转生产力了,而且可预见的是这一脚油门下去后面还会出现更猛的
    1258
        13
    1258  
    OP
       2h 56m ago
    @necZhang711 reddit 呀
    coefu
        14
    coefu  
       2h 40m ago
    @1258 推理端,其实还有更省电的。

    最屌的是 ,近存计算,在 ssd 上面焊接一个 FPGA ,把算子烧进 FPGA ,直接绕过内存墙。不过这个得看 FPGA 的算力进展了。或许也要单独供电,但是肯定也比整机功耗低。

    现在瑞芯微 RK182X 系列 就是在 m.2 上面搞得 堆叠 RAM ,有 1TB 的带宽,直接悍在 FPGA 周边的。不过容量被瓶颈在 5G B ,搞不上去了。还得是看 存储厂商。
    realJamespond
        15
    realJamespond  
       1h 58m ago
    opencode 批量重构调用子 agent 没有 3.6 好用,想半天,3.6 上来就直接干活,都是 unsloth ud q6
    tt83
        16
    tt83  
       1h 53m ago
    阿里云为啥自己不部署这个模型,3.8 Max 还是太贵
    acerphoenix
        17
    acerphoenix  
       8 mins ago
    @sentinelK 大模型只要不部署在私网不能联网,都可以自己外接 Agent 进行网络检索呀。就是现在单纯的哪个模型也没有网络检索能力呀,都是 Agent 给的。
    jaoyina
        18
    jaoyina  
       5 mins ago
    27b 的 coding 能力能到啥水平?
    565656
        19
    565656  
       Just Now
    @acerphoenix #17 有没有什么插件给 qwen3.8 联网的
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3316 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 61ms · UTC 11:51 · PVG 19:51 · LAX 04:51 · JFK 07:51
    ♥ Do have faith in what you're doing.