V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  sentinelK  ›  全部回复第 1 页 / 共 91 页
回复总数  1809
1  2  3  4  5  6  7  8  9  10 ... 91  
11 小时 30 分钟前
回复了 viskem 创建的主题 OpenAI 相比旗舰模型,低端模型更会说人话?
以后很有可能文学 LLM 和业务 LLM 会彻底分家,比如更多类似 https://huggingface.co/Altworld/Hemmingway-1 会冒出来。
11 小时 31 分钟前
回复了 viskem 创建的主题 OpenAI 相比旗舰模型,低端模型更会说人话?
@viskem 是的,我理解就是人话里面有太多“模糊”和“婉转”了。现实任务其实是定量的,或者说人类的活动为了精准故意设定成了定量为主。所以“讲人话”对于 LLM 的 Agent 场景来讲,其实是一种噪声信息,反而降低了统计学最优解的信噪比。
11 小时 50 分钟前
回复了 viskem 创建的主题 OpenAI 相比旗舰模型,低端模型更会说人话?
跟后训练对齐的方式有关。“人话”从目前的跑分(强化学习目标)的角度来讲,是一种很低效的指标。

换句话说,人话在 Agent 、Coding 这种场景是非常反效率的。
看楼上的回复,感觉好多人对于跨平台有很大误解。认为跨平台和原生的代码量是 1:2 ,我个人理解,无论是什么跨平台生态,和原生的代码量基本是 1:1.5 ,甚至是 1:1.3 。
自动停止是 cc-switch 代理转换的问题。

在目前,你可以理解为 codex 只能跑支持 responses API 的模型 provider
2 天前
回复了 FaustinaD 创建的主题 AirPods Airpods5 到手,说下感受
@sevenyangcc 楼主 @FaustinaD 当年的健身帖也是 v 站神帖,印象深刻。

我也是受到楼主的鼓舞才开始减肥的。
3 天前
回复了 tommyZZM 创建的主题 程序员 提示词工程师会最终出现吗?
提示词工程师我理解,就跟当年的“电梯工”一样。
属于基于现实硬件性能环境,以及特殊使用场景,诞生的一种纯临时性应急岗位。

现在医院这种超高人流量、突发事件比较多的场景依然有“电梯工”。
5 天前
回复了 tobacco 创建的主题 Android 豆包手机发布了,好像没啥讨论的
工具的核心就是得省精力。

目前所有的 Agent 其实本质上都是一件事上的注意力和精度之间的取舍。
你越选择少分担注意力(越多的交给 Agent 定夺),结果精度就越差。

然而现实生活中其实很少有那种需要占用巨大注意力,且可以接受低精度结果的场景。(毕竟你不可能把你所有的数据都交出来)

另外就是要求第三方自愿同意交出 app 的注意力权力给模型,其实是反人性反利益的。
不光是坟帖的问题,v 站有个权重算法,自己回帖、相同账号重复回帖基本不占权重。

看的人越多、越多不同的人回帖,越靠前。
@yh7gdiaYW 可能是跟 claude code 接入 GPT 模型需要代理有关,代理还是有信息损失和额外干扰。

不过这个结果确实有点娱乐效果。太逗了。
@longaiwp 千问系列就明确官方跑分都是 claude code 环境,反正模型结构注定放弃响应速度了,不如提高跑分上限。
@Jerry02 是,所以我认为“租金”这个成本定义不贴切。
@niubilewodev 好奇的就是这个常数,5.71$/秒,其实是可以根据商电(暂定 1 人民币/千瓦时)、卡租金( 5090 4 美金/小时)反推的。大概是等效 5000 张 5090 ,感觉少了点……
决定最终产出倾向和格式的是后训练以及微调。
所以其实理论上讲,只要是开放权重的模型,有硬件,任何人都可以做到楼主说的效果。

但是工程学要讲究性价比。作为一个闭源模型,作恶没必要搞这么复杂。
gpt6 的和 gemini 给的分辨率都不同(看围裙的色块层次就可以)。结合你上面实际截图的可视距离,有没有可能 gemini 给你的方案你根本就看不全?
轻度使用可以。但是实际工作中千万不能这么用,AI 会自作聪明,搞混。

比如两个非常相似的日程,AI 的记忆会串台。
9 天前
回复了 Haku 创建的主题 程序员 自部署模型卖 Token 能赚钱吗?
@Haku 简单说就是,对于大模型,使用人数和成本的关系是指数的。

每多加一个人,成本都翻一个次方。直到到一个规模化平台。
9 天前
回复了 Haku 创建的主题 程序员 自部署模型卖 Token 能赚钱吗?
@Haku 这不光是配套工具那么简单。

1 、你没有官方的运行环境,所以你的显卡利用率一定不如官方。

2 、你没有配套生态,比如 Minimax H3 是有对应的 designer 工具免费提供的。能通过摆 3D 小人精准控制走台和运镜。还能自动生成分镜和剧本。多媒体模型还要缓存素材、生成结果。minimax H3 官方是 7 天免费存储的,你算算 7 天的巨量缓存成本是多少。

3 、你没有官方的部署经验,官方有海量硬件,所以可以根据推理情况灵活调配负载,你的硬件总数是固定的,所以只有一个甜点。一旦用户负载有波动,你的体验就直线下降。

最终结果就是,你的 pp/tg 比官方慢,缓存命中率低,有时候还要整个 session 重新 prefill ,还比官方贵。

视频模型更惨,排队排到死不说,素材传不上去,传上去了调不出来,还没官方的设计工具……
9 天前
回复了 Haku 创建的主题 程序员 自部署模型卖 Token 能赚钱吗?
LLM 不赚钱。你看各大服务商哪个价格能做到比官网便宜就知道了。尤其是 deepseek 这类。

视频模型自部署的问题是官网其实是一整套流程,但 Minimax H3 只开源了视频生成部分。
如果从工作量上讲,H3 开源的生态只占大概 40%左右。
@wwwwjack
@johnbobby

这叫“逆概率谬误”,通缉犯脸上有道疤 ≠ 脸上有疤的都是杀人犯
1  2  3  4  5  6  7  8  9  10 ... 91  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1243 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 26ms · UTC 17:24 · PVG 01:24 · LAX 10:24 · JFK 13:24
♥ Do have faith in what you're doing.