BingoXuan

BingoXuan

V2EX member #170096, joined on 2016-04-22 13:23:09 +08:00
Today's activity rank 8733
Per BingoXuan's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
BingoXuan's recent replies
等 Qwen3.8 35BA3B 吧。3.8 27B 最大问题不是权重。而是 kv cache 。q8 量化跑满 262k 上下文要 8-9G 显存。开 turbo quant 有损失。即使是 Blackwell 显卡,vllm 和 sglang 都还没支持完整的 nvfp4 kv cache 支持
7 days ago
Replied to a topic by OBJECTION 健身 中登有多少在健身的...
一三五去游半个小时
11 days ago
Replied to a topic by netox 分享发现 在线体验 16K token/s 的新大模型部署架构
@cowcomic
deepseek 激活也是 13B 。这时候就是 xilinx 出马了,通过 pcie 重新烧录权重数据。那样 n 张互联就能跑 deepseek v4 flash 0731 了。主要问题是如何把权重数据变成可烧录。
@Hyschtaxjh
六面骰子一样不够随机。参考 cloudflare 办公室的随机数采样
我昨天一天就消耗了 65%了。现在 review 也是用自己部署的 27B 在干。感觉就是逼着人升级 Pro (因为不禁用,我有这个升级想法)
Jul 25
Replied to a topic by rpish 问与答 技术已死?
以前的技术是不同个体探索得到的知识和经验,现在探索都靠 AI 了,经验都被模型厂吸收了转换到模型中。所以技术更多是,和 AI 协作过程中,个体未知知识是否被消化。
Jul 21
Replied to a topic by Leon6868 程序员 多端 GUI 真的没有银弹吗
@Leon6868
skill+多模态+playwright 能加速回环。小模型可以用来验证流程和细节提供相关信息,大模型负责实现。
Jul 21
Replied to a topic by Leon6868 程序员 多端 GUI 真的没有银弹吗
@Leon6868
去年就用 webgl shader 实现了一个实时波形渲染,300 个信号,信号长度 2k ,120fps 点毫无压力。web 反馈回环非常快,AI 很擅长的。如果 AI 就是一个 compiler ,那么任何框架都不重要
R.I.P. 也许写信个 tim cook 更有效,但前提是怎么这台手机是你妻子购入或者所有的
@JimLee0921
完全是过度优化了。fastapi 性能没那么不堪,而且 agent 都是重 io 的。套一层 go 并不会提高性能。反而降低了可观察性。有这个时间应该把 fastapi 的可观察性提高,确认性能瓶颈和找 bug 而不是盲目换语言。如果架构足够清晰,第一点既不是问题。llm 返回的流如何缓存,用户网络抖动断开重连如何恢复等细节都会处理好。换语言不影响架构,尤其现在 LLM 重写有太多成功例子。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5481 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 13ms · UTC 07:46 · PVG 15:46 · LAX 00:46 · JFK 03:46
♥ Do have faith in what you're doing.