你们会用deepseek吗?
最近我看到很多信息,包括reddit, youtube,都在向我展现了deepseek的威力,据说deepseek的调用量远远大于其他模型。
当然这里面的原因也是很简单的:因为deepseek足够便宜,然后能力又还差不多。
我个人是把一些Agent接到了deepseek上。我实在没办法去用claude或者gpt,太贵了。20美元/月的quota远远不能满足我的需求啊。那就订200美元,那又实在太高了。我还远远不能用它来盈利,怎么可能在此花费那么高的成本?
关键是很多西方的中小公司都在调用它。
所以我觉得deepseek还是有它的鲇鱼效应的。当然在蒸馏这件事上我不好做价值判断:确实我没有这个能力做判断。这个事情只能交给openai, gemini, claude这些大模型的厂商亲自来做了。我们很难对此置喙。
我是觉得能够用上平民化的价格,对谁来说都是好事。
我不知道品葱的人们会不会用Agent,需不需要调用这背后的大模型。可能你不需要,那这个话题对你来说也就没有多大意义了。
当然这里面的原因也是很简单的:因为deepseek足够便宜,然后能力又还差不多。
我个人是把一些Agent接到了deepseek上。我实在没办法去用claude或者gpt,太贵了。20美元/月的quota远远不能满足我的需求啊。那就订200美元,那又实在太高了。我还远远不能用它来盈利,怎么可能在此花费那么高的成本?
关键是很多西方的中小公司都在调用它。
所以我觉得deepseek还是有它的鲇鱼效应的。当然在蒸馏这件事上我不好做价值判断:确实我没有这个能力做判断。这个事情只能交给openai, gemini, claude这些大模型的厂商亲自来做了。我们很难对此置喙。
我是觉得能够用上平民化的价格,对谁来说都是好事。
我不知道品葱的人们会不会用Agent,需不需要调用这背后的大模型。可能你不需要,那这个话题对你来说也就没有多大意义了。
对弱智来说,ai是需要的,未来还会变成必须的。
就像对废物来说,玩网是必要的,结果就是互联网成为粪坑,任何地方都不例外。
ai现在还没有完全成为这种东西,因为还不够无脑。
现在用还有点图一乐看个热闹的价值,普及了再用跟吃屎就没有区别了。
不过也没什么变化就是了,反正网友本就天天吃屎,嫌弃不够还得满世界找。
就像对废物来说,玩网是必要的,结果就是互联网成为粪坑,任何地方都不例外。
ai现在还没有完全成为这种东西,因为还不够无脑。
现在用还有点图一乐看个热闹的价值,普及了再用跟吃屎就没有区别了。
不过也没什么变化就是了,反正网友本就天天吃屎,嫌弃不够还得满世界找。
deepseek 与 grok 都在我抵制列表里, 还有什么狗屎文心一言等,
若 AI 跟智能手机重要性相若了,
我去部署边缘 AI 也不会用这些匪产的 "政治说服机器人".
若 AI 跟智能手机重要性相若了,
我去部署边缘 AI 也不会用这些匪产的 "政治说服机器人".
井水不犯河水,山猪不吃细糠。中国特色的玩艺儿是支那猪专属,其他人消受不起支里支气。
简单的问题就用国产的,不用白不用,关键问题还是gemini解决,之前让ai帮忙分析将每个月的日期按星期划分,所有国产ai都搞错了,gemini一秒钟解决。
更便宜的token,更多的用户,更多的算力放到推理而非训练,怎么就对所有人有利了?
模型训练的核心是单一同步域显卡集群,单纯比较总量算力意义不大。决定token价格的则是显卡的机会成本,中国a100时代留下的42个万卡集群24年后基本上无法用于模型训练,显卡的机会成本很低(虽然实际推理成本更高,但是token价格很低,反正只有走私的千级显卡可以做单一同步域显卡集群训练,存量显卡闲着也是闲着,多卖点推理服务赚钱。)
还有agent用deepseek(ー_ー)!!?deepseek 25年吹上天的GRPO方案在agent后训练上面是大坑,只是单轮tooluse的话可以直接到openrouter/Google Ai Studio用免费额度
模型训练的核心是单一同步域显卡集群,单纯比较总量算力意义不大。决定token价格的则是显卡的机会成本,中国a100时代留下的42个万卡集群24年后基本上无法用于模型训练,显卡的机会成本很低(虽然实际推理成本更高,但是token价格很低,反正只有走私的千级显卡可以做单一同步域显卡集群训练,存量显卡闲着也是闲着,多卖点推理服务赚钱。)
还有agent用deepseek(ー_ー)!!?deepseek 25年吹上天的GRPO方案在agent后训练上面是大坑,只是单轮tooluse的话可以直接到openrouter/Google Ai Studio用免费额度
已隐藏
已隐藏
支那猪自愿贱卖自己的劳动力为全世界生产廉价产品,为何不用
已隐藏
墙内的AI不能解决意识形态层次的问题。我倒是好奇像deepseek这样的AI,用境外手机号注册,或者用境外流量使用的话,还需不需要服从党的领导。
deepseek价格上存在优势,但是AI幻觉确实有些问题,综合来看在某些场景下还是可以用用。
Deepseek这个墙内大吹特吹的东西,我偶尔无法翻墙是会用的
有时候问题不是很复杂,我认为它可能搞得定,很多次我满怀期待打开它,然后看到一堆弱智回复。
有时候问题不是很复杂,我认为它可能搞得定,很多次我满怀期待打开它,然后看到一堆弱智回复。
muse spark的价格比deepseek低,gpt luna和deepseek价格差不多。deepseek只适合不能翻墙的人。
已隐藏
除非你被牆到上不了外網,否則根本沒理由去用 DeepSeek!我自己用 Gemini 都用得愈來愈火大。不過說實話,絕大多數人本來就沒必要花錢去付費使用。在牆內用那是迫不得已,那些天天吹捧說為了開源、為了便宜才用的人,九成九都是在裝腔作勢、扮高深!
用Agent?什么免费你就用/薅什么,前一阵免费用qwen/qoder 发现基本活都能干,注意非实名无支付账号,全虚拟机环境,数据随它收集
已隐藏
不会用,除非在特殊情况下,比如没有其它选择,或者deepseek推出完全免费且高效的服务
没听说过 搜索了一下发现是中共得垃圾 网站都打不开 用不了 一看就是骗子
已隐藏
已隐藏
我司各种顶级模型token不限量随便用,没人用DeepSeek这种破烂。
会。
deepseek容易破甲,而且API便宜。不过最近Chatgpt Luna出了,价格比deepseek还有竞争力,如果复杂任务肯定是优先chatgpt和claude的。
deepseek容易破甲,而且API便宜。不过最近Chatgpt Luna出了,价格比deepseek还有竞争力,如果复杂任务肯定是优先chatgpt和claude的。
本人非it行业。
之前所在的日企,浏览网站要求直接禁用baidu。
至于私人方面,注册deepseek还需要手机号。凡是要个人信息的一律不用。
之前所在的日企,浏览网站要求直接禁用baidu。
至于私人方面,注册deepseek还需要手机号。凡是要个人信息的一律不用。
我女人经常帮我deepsuck,不是因为她深爱我,只是因为我小黄蛆短而已
不会。
首先我知道现在有非常多的人喜欢吹国产开源模型,理由又是那些老掉牙的回答,无非是 DeepSeek 便宜实惠,能力又接近 Claude 或者 GPT,性价比非常高。但我要先说明一件事:99% 的人根本没有使用开源模型的需求。因为99% 的人压根就没有开发需求。很多人现在是整魔怔了,我先说个暴论,大部分人的日常需求,甚至就连豆包都能满足。至于为什么很多人觉得不够用,这个我后面会说。
1.吹开源的人,绝大多数根本没在用开源
满血 DeepSeek 是 671B 的 MoE,光权重 FP8 就要几百 GB 显存,个人设备连门都摸不到。所以他们嘴里的"我用 DeepSeek",实际上是在调官网或者第三方 API——那本质还是在用别人的云服务,跟"开源"这个卖点一毛钱关系都没有。
剩下那部分是在本地跑 7B、32B 的蒸馏版,然后拿这个的表现去论证"国产开源已经接近 Claude 了"。这就是纯粹的偷换概念。
2.所谓"能力差不多"的那些跑分
真了解一点的人就知道,AI 测评在很大程度上是个自说自话的东西,是黑箱。
这跟手机跑分是一个道理,但它比手机跑分还黑。手机跑分起码底下还压着硬件,制程、核心、频率、散热是实打实的物理存在,你可以拆开验,可以用别的方式交叉验证。而模型的分数背后是什么?没有任何东西可以让你独立复现。
而且模型这边还有一个手机没有的作弊路径:测试集污染。主流 benchmark 的题目全在公开网络上躺着,训练数据里有没有、有多少,只有厂商自己知道,外面根本查不了。刷一个特定榜单的分,成本远低于真正提升泛化能力。
所以你会经常看到那种榜单上打平甚至反超、一上手实际任务立刻现原形的模型。差距不在题目里,在长上下文的稳定性、指令遵循的精度、agent 场景下的连续决策这些根本没法用一个数字概括的地方。
说白了,跑分是厂商发的成绩单,不是第三方出的体检报告。你信它,是因为你没有验证手段,不是因为它可信。
3.那如果你真从事编程呢?
真正干这行的知道我在说什么——实际业务里大头是 CRUD、样板代码、配置、调试、写测试,真正需要顶级推理能力的场景占比极小。你们会发现实际工作里连 Claude Fable 都用不上,Sonnet 这一档就已经溢出了,性能是过剩的。
既然性能都是过剩的,额度自然也是够用的。现在 Codex 的 Plus 对绝大多数人的工作量来说根本就是富余的,甚至很多人连 Claude 的免费额度都用不完。
那些嚷嚷额度不够用的,只有两种人。一种是真正骨灰级、工作中重度产出的——而对这批人来说,模型这点钱根本不算钱,什么好用就用什么,完事了。所以"便宜"这个卖点在专业场景里其实是自我否定的:一个工程师的时薪摆在那,省下的那几十刀,还不如换个顺手的工具多产出半小时。只有在你的产出本身不值钱的时候,省这点钱才划算——而这恰恰说明,你不是需要它的那批人。
另一种,就是下面要说的了。
4.屁事没有还能把额度烧完的人
非常抱歉,大概率不是你事情多,而是你根本就不会用 AI,连斜杠命令都不知道有。
"额度不够"在九成情况下是上下文管理事故,不是工作量事故。不做管理的人,一个 session 就能把几十万 token 烧在读无关文件、反复重试、把整个仓库怼进上下文上面。会用的人有 CLAUDE.md、有斜杠命令、有明确的任务边界,该 compact 就 compact。同样的活,token 消耗能差一个数量级。
但更深一层的东西是:token 消耗真正的分水岭,不在于你会不会用 AI,而在于你自己的工程能力有多强。
这两件事经常被混为一谈,其实完全不是一回事。前者是操作技巧,后者是决策能力,而决策能力才是 token 的真正大头。
你想想一个什么都不懂的人是怎么用 AI 做项目的:技术选型交给 AI,那就是一轮又一轮的探索性对话,让它列方案、比优劣、讲取舍。架构怎么切也交给 AI,又是几轮。然后开始写,写完他看不懂,所以 AI 的每一次输出都必须附带大段自然语言解释,否则他没法验收——他的 token 里有很大一部分根本不是在生产代码,是在生产给他看的说明文。再往后,方案本身是错的,但他判断不出来,要走三四轮才撞墙,前面所有的上下文全部变成沉没成本,推倒重来。出了 bug 他也定位不了,只能让 AI 满仓库去搜、去读、去猜。
整个流程里,AI 同时扮演了架构师、实现者、讲师和验收方,四个角色的 token 全在他账上。而其中三个角色的钱,本来是不用花的。
而你自己懂的时候呢?技术选型你心里早就有数了,这部分对话根本不发生。架构边界是你划的,你直接把接口、数据结构、约束条件写清楚。定位问题你自己看堆栈,直接甩文件路径加行号,而不是"你帮我找找哪里错了"。
你给 AI 的不是意图,是规格。AI 在这里被降格成了纯执行层,一个高级的、能理解自然语言的代码生成器,仅此而已。
这带来的差别是结构性的,不是量级上的:
你越强,AI 越省;你越菜,AI 越贵。
这跟很多人的直觉正好相反——他们以为不会写代码的人才最该用 AI,实际上不会写代码的人用 AI 的单位成本是最高的,因为他必须为自己缺失的判断力付费,而这个费用是按 token 计的。
所以回到开头那句:大部分情况不是 AI 太笨了,而是你根本不会用 AI。那些天天喊额度不够的人,真该想想自己烧掉的那些 token,到底是在解决问题,还是在替自己补课。
最后堵两个口子,省得有人拿这个来杠
私有化部署是真需求。金融、政务、医疗这种数据不能出内网的场景,开源权重是刚需,这个我完全承认。但这跟"个人用户在网上吹 DeepSeek 性价比"是两码事。
可及性是真问题。墙内用户访问 Claude/GPT 确实有支付和合规门槛,这是客观存在的。但这是"用不了",不是"不如"——请把这两件事分开说。
首先我知道现在有非常多的人喜欢吹国产开源模型,理由又是那些老掉牙的回答,无非是 DeepSeek 便宜实惠,能力又接近 Claude 或者 GPT,性价比非常高。但我要先说明一件事:99% 的人根本没有使用开源模型的需求。因为99% 的人压根就没有开发需求。很多人现在是整魔怔了,我先说个暴论,大部分人的日常需求,甚至就连豆包都能满足。至于为什么很多人觉得不够用,这个我后面会说。
1.吹开源的人,绝大多数根本没在用开源
满血 DeepSeek 是 671B 的 MoE,光权重 FP8 就要几百 GB 显存,个人设备连门都摸不到。所以他们嘴里的"我用 DeepSeek",实际上是在调官网或者第三方 API——那本质还是在用别人的云服务,跟"开源"这个卖点一毛钱关系都没有。
剩下那部分是在本地跑 7B、32B 的蒸馏版,然后拿这个的表现去论证"国产开源已经接近 Claude 了"。这就是纯粹的偷换概念。
2.所谓"能力差不多"的那些跑分
真了解一点的人就知道,AI 测评在很大程度上是个自说自话的东西,是黑箱。
这跟手机跑分是一个道理,但它比手机跑分还黑。手机跑分起码底下还压着硬件,制程、核心、频率、散热是实打实的物理存在,你可以拆开验,可以用别的方式交叉验证。而模型的分数背后是什么?没有任何东西可以让你独立复现。
而且模型这边还有一个手机没有的作弊路径:测试集污染。主流 benchmark 的题目全在公开网络上躺着,训练数据里有没有、有多少,只有厂商自己知道,外面根本查不了。刷一个特定榜单的分,成本远低于真正提升泛化能力。
所以你会经常看到那种榜单上打平甚至反超、一上手实际任务立刻现原形的模型。差距不在题目里,在长上下文的稳定性、指令遵循的精度、agent 场景下的连续决策这些根本没法用一个数字概括的地方。
说白了,跑分是厂商发的成绩单,不是第三方出的体检报告。你信它,是因为你没有验证手段,不是因为它可信。
3.那如果你真从事编程呢?
真正干这行的知道我在说什么——实际业务里大头是 CRUD、样板代码、配置、调试、写测试,真正需要顶级推理能力的场景占比极小。你们会发现实际工作里连 Claude Fable 都用不上,Sonnet 这一档就已经溢出了,性能是过剩的。
既然性能都是过剩的,额度自然也是够用的。现在 Codex 的 Plus 对绝大多数人的工作量来说根本就是富余的,甚至很多人连 Claude 的免费额度都用不完。
那些嚷嚷额度不够用的,只有两种人。一种是真正骨灰级、工作中重度产出的——而对这批人来说,模型这点钱根本不算钱,什么好用就用什么,完事了。所以"便宜"这个卖点在专业场景里其实是自我否定的:一个工程师的时薪摆在那,省下的那几十刀,还不如换个顺手的工具多产出半小时。只有在你的产出本身不值钱的时候,省这点钱才划算——而这恰恰说明,你不是需要它的那批人。
另一种,就是下面要说的了。
4.屁事没有还能把额度烧完的人
非常抱歉,大概率不是你事情多,而是你根本就不会用 AI,连斜杠命令都不知道有。
"额度不够"在九成情况下是上下文管理事故,不是工作量事故。不做管理的人,一个 session 就能把几十万 token 烧在读无关文件、反复重试、把整个仓库怼进上下文上面。会用的人有 CLAUDE.md、有斜杠命令、有明确的任务边界,该 compact 就 compact。同样的活,token 消耗能差一个数量级。
但更深一层的东西是:token 消耗真正的分水岭,不在于你会不会用 AI,而在于你自己的工程能力有多强。
这两件事经常被混为一谈,其实完全不是一回事。前者是操作技巧,后者是决策能力,而决策能力才是 token 的真正大头。
你想想一个什么都不懂的人是怎么用 AI 做项目的:技术选型交给 AI,那就是一轮又一轮的探索性对话,让它列方案、比优劣、讲取舍。架构怎么切也交给 AI,又是几轮。然后开始写,写完他看不懂,所以 AI 的每一次输出都必须附带大段自然语言解释,否则他没法验收——他的 token 里有很大一部分根本不是在生产代码,是在生产给他看的说明文。再往后,方案本身是错的,但他判断不出来,要走三四轮才撞墙,前面所有的上下文全部变成沉没成本,推倒重来。出了 bug 他也定位不了,只能让 AI 满仓库去搜、去读、去猜。
整个流程里,AI 同时扮演了架构师、实现者、讲师和验收方,四个角色的 token 全在他账上。而其中三个角色的钱,本来是不用花的。
而你自己懂的时候呢?技术选型你心里早就有数了,这部分对话根本不发生。架构边界是你划的,你直接把接口、数据结构、约束条件写清楚。定位问题你自己看堆栈,直接甩文件路径加行号,而不是"你帮我找找哪里错了"。
你给 AI 的不是意图,是规格。AI 在这里被降格成了纯执行层,一个高级的、能理解自然语言的代码生成器,仅此而已。
这带来的差别是结构性的,不是量级上的:
- 上下文投喂粒度从"整个目录"降到"这三个函数"
- 单次命中率大幅上升,因为规格明确的任务本来就不容易做错
- 返工率趋近于零,因为方向是你定的,不会走到第三轮才发现路线本身有问题
- 验收成本几乎为零,你扫一眼 diff 就知道对不对,不需要 AI 反过来给你讲课
你越强,AI 越省;你越菜,AI 越贵。
这跟很多人的直觉正好相反——他们以为不会写代码的人才最该用 AI,实际上不会写代码的人用 AI 的单位成本是最高的,因为他必须为自己缺失的判断力付费,而这个费用是按 token 计的。
所以回到开头那句:大部分情况不是 AI 太笨了,而是你根本不会用 AI。那些天天喊额度不够的人,真该想想自己烧掉的那些 token,到底是在解决问题,还是在替自己补课。
最后堵两个口子,省得有人拿这个来杠
私有化部署是真需求。金融、政务、医疗这种数据不能出内网的场景,开源权重是刚需,这个我完全承认。但这跟"个人用户在网上吹 DeepSeek 性价比"是两码事。
可及性是真问题。墙内用户访问 Claude/GPT 确实有支付和合规门槛,这是客观存在的。但这是"用不了",不是"不如"——请把这两件事分开说。
