你国ai大厂盗窃扭曲了“开源”的含义并故意搅浑水
传统意义上的开源:开放源代码,每个看到源代码的人都可以完整的理解,使用和编辑整个项目,开源社区里每个人都可以参与项目共创
大模型厂嘴里的“开源”,仅提供成品模型,训练算法和数据集全都是严格保密的商业机密,下载了模型的社区用户除能够做的改动仅有微调权重,传统开源追求的社区共创完全不成立
正因此,你国ai大厂整天嚷嚷的“开源”实际上也和西方国家的开源精神完全没有关系,本质还是在自己没有足够算力的情况下,背靠国家意志的统一指挥和资金补贴低价分发模型使用权,让不需要支付训练成本的服务器提供商用更低的价格倾销tokens,和光伏,电动车一样本质是国家力量极限压缩产品价格以压垮西方同行的“中国制造”老套路,但是这种牛马经济窃取“开源”这个概念给自己脸上贴金,明显是对开源精神的侮辱
大模型厂嘴里的“开源”,仅提供成品模型,训练算法和数据集全都是严格保密的商业机密,下载了模型的社区用户除能够做的改动仅有微调权重,传统开源追求的社区共创完全不成立
正因此,你国ai大厂整天嚷嚷的“开源”实际上也和西方国家的开源精神完全没有关系,本质还是在自己没有足够算力的情况下,背靠国家意志的统一指挥和资金补贴低价分发模型使用权,让不需要支付训练成本的服务器提供商用更低的价格倾销tokens,和光伏,电动车一样本质是国家力量极限压缩产品价格以压垮西方同行的“中国制造”老套路,但是这种牛马经济窃取“开源”这个概念给自己脸上贴金,明显是对开源精神的侮辱
40 个评论
>> 是这样的:所谓AI训练是在寻找一个大函数,这个函数可以根据输入,得到输出。这个函数的参数,就是...
不不不
现代ai的各种架构,本质都是一回事
就是在各种抽象,一级抽象,二级抽象,三级抽象,乃至n级抽象
最后抽象到 潜空间,也就是latent space, 一个不知道多少维度 (几万亿是有的)的高维空间里。
抽象到高维空间之后,在进行还原或者synthesis,基本是和抽象的相反过程。就是脑补,补充各种细节,一级一级的加细节。 最后加出来的东西,看看跟原来的抽象过程的原数据能差多少。 这个差异最小化的过程 就是所谓的无监督学习。
这玩意 最开始是用于图像,也就是卷积深度网络,图像是2维数据。 后来是用于文字,文字是一维数据,就不能用2维数据的卷积那套来抽象。 用的是attention mechanism来抽象。我觉得这种基于文字或者语言的机制 应该是能诞生出智能的。 因为人活着说生物的大脑进化就是从处理视觉信息开始,到最终阶段 诞生出语言能力。 诞生出语言之后,也就是大脑皮层是专门用来处理语言的,抽象的级别可以加到无限高