jinsongzhaocn's recent timeline updates
jinsongzhaocn

jinsongzhaocn

V2EX member #460727, joined on 2019-12-22 23:54:22 +08:00
Today's activity rank 18906
jinsongzhaocn's recent replies
@liangyuan1985 几天前更新了一些 think 部分的内容,不知道替换后效果如何?
最近几个月折腾硬件不划算,内存涨疯了,动不动就 1 万以上
3 days ago
Replied to a topic by chongzi 程序员 deepseek-v4-flash 大家有感觉出问题吗?
DeepSWE v1.1 智能编程/软件工程智能体基准
Kimi K3:67.5%
GLM-5.3-Flash:63.4%
Qwen3.8-Flash-Next:58.7%
DeepSeek-V4-Flash-0731:54.4% (分数基本等于本地部署 Qwen3.8-Flash-Next Q4 量化版本)
类似用网页版出文档和方案。利用知识量大但是便宜的出方案,用编程推理强的写代码。这个套方法也可以混合使用。我觉得知识最新的应该是谷歌,毕竟是最大搜索引擎;历史知识最多的应该是 ChatGPT ,最早最便宜时就开始收集知识;专业知识最多的应该是 Authropic ,后来者胜出总要靠更优质的知识来训练。
4 days ago
Replied to a topic by chongzi 程序员 deepseek-v4-flash 大家有感觉出问题吗?
长上下文堆积,涉及的问题越来越复杂吧,需要靠压缩和记忆体优化。flash 版本通常是缩小知识量的版本,所以解决有确定方案的问题,日常编码可以;但是探讨方案,解决未知问题,理解复杂逻辑,需要切换到 pro 版本,用更多的知识量更好。codex 至少 5T 的参数,dsv4flahs 不到 1T,知识量就差了一大截。
4 days ago
Replied to a topic by pureGirl 职场话题 现在做什么技术的最容易找工作
你的隐藏前提是找好工作。否则当然是需求越多,越没技术的工作,收入也越低的容易了
5 days ago
Replied to a topic by imingyu 程序员 Deepseek 三小时不到就耗了 30 块
跟你做什么开发有关。最好的组合是本地部署一个小模型,数据处理类型工作交给本地模型,代码编写上云模型。比如你的开发工作需要上传一本长篇小说,然后总结内容,看似简单,那 token 烧起来吓死你。
Aug 27
Replied to a topic by SSang 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@paranoiagu --cache-type-k q4_0 --cache-type-v q4_0 这两个参数试过 q8_0 吗,不知道这样的精度--ctx-size 要不要减半。“编程场景优先选 q8_0/q8_0 ,行业公认甜点配置”
国外国产模型的调用量已经遥遥领先了。除非你不看性价比,就要最贵最好的。其实国外模型也就知识量丰富很多,用网页版薅羊毛,分析结果贴给国产模型,组合使用就是最佳性价比了。
@nakun233 这个论据不充分,linux 够庞大了吧,你维护 linux 会累,但是总有人可以维护它,而且 linux 升级还如此活跃。说明你的假设就有前提,你希望 dsh 是个 tools ,但 ds 的初心却是 os 。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3179 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 16ms · UTC 13:39 · PVG 21:39 · LAX 06:39 · JFK 09:39
♥ Do have faith in what you're doing.