加入怡居
過去7年,我司每年平均捐出52%純利作慈善用途,款額動輒以百萬元計,可稱實 至名歸的社會企業。閣下光顧我司,是變相自己做善事!日後請多多光顧為感!
尖沙咀總行 : 2569 2192
太古城華山分行 : 2569 1339
沙田銀禧分行 : 2636 1380
太古城明宮分行 : 2560 3738
沙田第一城專責組 : 2647 1838
杏花邨專責組 : 2898 0007
尖沙咀總行 : 2569 2192
太古城華山分行 : 2569 1339
沙田第一城專責組 : 2647 1838
沙田銀禧分行 : 2636 1380
太古城明宮分行 : 2560 3738
杏花邨專責組 : 2898 0007
   回應 : 0
奇、趣、妙、識
范蠡大模型4.0:千亿参数并不重要,真正的护城河在鱼塘边攒了三十年
罗辑思维
2026年9月9日
(原文发表于2026年9月4日)
 

最近我看到一条新闻,中国农业大学发布了“范蠡大模型4.0”,号称是首个渔业大模型。我当时扫了一眼标题,4000亿参数教人养鱼,第一反应是,好家伙,现在连养鱼都要上大模型了。

本来我就是当做一个行业官方新闻来看看,没有打算深入研究。但我从新闻稿里看到了一句话,说“4.0版本算力跃升到3970亿参数”。咱们AI学习圈的老同学都知道,参数指的是这个底座模型的尺寸大小,而算力指的是运行这个模型有多少卡,很少有把算力和参数放在一起说的。当然,尽管新闻稿里把参数说成了算力,也还是让我对这个项目有了一点儿好奇心。

等我真去翻了翻资料,我发现这事儿比口误有意思多了。它掀开的,其实是我最近一直在琢磨的一个问题:AI这么强了,接下来到底拼什么。

先说这个模型本身是个啥。8月17日,它是在北京开的一个国际智慧渔业大会上发布的,官方给的数字是3970亿参数,覆盖八个养殖维度:水质、品种、饲料、健康、运营、装备、能源、经济,整合了101个主要养殖品种的知识。

同时还发布了一套公开数据集,11.6万帧图像,69.8万条任务标注。FAO,也就是联合国粮农组织的官员也到场了。

先说说这大模型的名字,范蠡。为啥叫范蠡呢?范蠡就是那个帮越王勾践复国,功成之后带着西施泛舟五湖的那位。他退隐之后干了两件事,一是做生意做成了陶朱公,被后世当财神拜;二呢,相传他写过一本《养鱼经》,是中国最早的养鱼专著。我这里之所以加个“相传”,是因为有人考证,这本书多半是汉代人托了范蠡的名,未必是他亲笔。但不管怎么说,两千多年前,中国人就开始琢磨怎么科学养鱼了。

所以你看,一个AI模型叫范蠡,这名字本身就在提醒你:这不是AI来了之后才凭空冒出来的新东西。

这一点特别重要。我去扒了一下这个模型背后的团队,中国农大李道亮教授这一拨人,他们干这行不是三年五年了。九十年代末就在做鱼病诊断的专家系统,2004年以后,又从软件一路往硬件走,开始搞水质传感器等研究,2019年成立了国家数字渔业创新中心,一直到2024年才有了范蠡大模型1.0。

你算算,从九十年代末到现在,快三十年。三十年,一代人的时间,全泡在鱼塘边上,一点一点攒水质数据、攒鱼病样本、攒投喂记录。这才是重点。

范蠡大模型4.0不是AI时代的从0到1,它是一个已经干了近三十年的老研究,在2024年前后,突然接上了AI这台加速引擎。之前用最笨的办法一条一条采、一年一年攒下来的东西,AI来了之后,突然能吃得下、能算得动、能一下子融会贯通了。

现在回到前面提到的那个数字,3970亿参数。

我猜,这个3970亿,大概率不是他们从零训出来的。一个渔业团队,再有钱,也不太可能自己烧一个近4000亿参数的大模型出来,那可能是几千万美元一次的训练成本,不是一般学术机构能扛的。更合理的解释是,他们拿了一个现成的开源通用大模型做底座,再往上叠自己的渔业数据。

而且这个数字巧得有点过头。阿里前阵子开源的Qwen3.5,恰好就是3970亿总参数,单次激活170亿。数字精确重合到这个地步,你说是巧合,其实我是不太信的。再结合前面把参数说成算力的那个口误,你大概就能明白,参数和模型训练这块可能真不是他们最熟的部分,他们熟的是鱼。

但在这里,我必须要说一句,这么干,一点儿问题都没有,这是现在最现实、最高效的做法。你的核心竞争力是三十年的养殖数据和行业洞察,那你就应该把钱和精力全砸在这上面。

底座这种通用能力,市面上有强大又免费的,拿来用就好了,何必自己重复造轮子。其实这也是我们国内AI的优势所在,从DeepSeek到智谱到千问到Kimi,有众多强大的开源免费模型可以选择,会帮助更多类似的研究团队站在巨人的肩膀上,发挥自己的特长。

但这么一想,一件特别有意思的事情就浮出来了。

既然范蠡大模型4.0是通用底座加专有数据,那它的能力增长就有了两个轮子。一个轮子是底座,通用大模型每升级一次,它啥都不用干,能力就跟着涨一波。今年是Qwen3.5,明年可能就是4.0、5.0,底座越来越聪明,它就越来越聪明。

另一个轮子是数据,鱼塘边上的传感器一天24小时不停地采,专有数据越攒越多,模型对渔业的理解就越来越深。

两个轮子,一个靠外部的通用技术进步,一个靠自己的持续积累,同时往前转。这就形成了一个复利:你不用两头都使劲,只要守住数据这一头,另一头的红利会自动飘过来。滚着滚着,这个雪球就越来越大,而且是加速变大。

聊到这儿,本来可以收尾了。但我顺着这个逻辑往下想,会发现一个更有意思的东西。复利只是个结果。你得再往回问一句:凭什么是它能吃到这个复利,别人不行?

底座是公开的,谁都能拿。所以底座这一头,不构成任何护城河。真正让范蠡大模型4.0跟别人拉开差距的,是另一头,是那三十年攒下来的、别人买不到也偷不走的东西。

这个东西具体是什么呢?我原来以为,就是那三十年攒下来的数据本身。你想啊,跨季节、跨品种、跨地域,每一条都带着最终的产量和死亡率结果,这种连续了三十年的真实数据,别人有钱也买不到,有时间也补不回来,这护城河还不够深吗?

我一开始也是这么想的,但后来越想越觉得不对。数据这东西,其实也会过时,会被新的采集方法、新的品种替代。今天最全的数据,十年后可能就是一堆老黄历。

真正更难贬值的,是比数据更底层的一样东西:那套让鱼塘能被机器读懂的标准。

你想想看,鱼塘边上插一根传感器,测出来一个溶氧量的数字。这个数字要有用,你得先定义清楚:什么叫溶氧、单位是什么、多久采一次、什么范围算正常、什么范围算鱼要出事。

一条鱼健不健康,用哪几个字段来描述;一台投喂机,按什么接口、什么格式把数据传上来,全都得你来定。

这一整套定义,就是我说的操作系统。它规定了整个渔业世界,该怎么被翻译成机器能听懂的语言。你把这套标准定下来了,全行业的传感器、投喂机、增氧机就都得说你的语言,往你的坐标系里传数据。

而这套东西,恰恰是最难、最花时间,也是最值钱的。

传感器会越来越便宜,通用底座会越来越强,这些都会慢慢变成白菜价。真正难以替代的,是谁定义了这套坐标系。一旦全行业的鱼塘、投喂机、增氧机都按你这套标准来接、来传数据,你就成了这个行业的地基。后来者哪怕模型比你强,也得先接入你的标准,才能跟这个行业对话。

而这个道理一旦想通,你会发现它早就在别的地方发生了。之前在广播站里,我也和你提到过很多次,有人在悄悄收购旧书,尤其是2022年之前出版的书,还有那之前的各种资料。最近我还了解到,有人在收集县级图书馆里存下来的县志、水文志等等。这些东西,都是平时很多人基本看不上,觉得不是什么有价值的数据。

你可能好奇,现在网上信息这么多,收这些老掉牙的资料干啥。我再给你举个例子,有一天,罗老师跟我说,他问了几个AI一个问题:“在北宋的时候,要用水陆结合的方式,从寿春到南阳应该怎么走?”

你看,就这么一个问题,其实要调用的专门知识非常多。最起码,你得知道北宋时期淮河的河道走向、当时有哪些码头,水路和陆路又是怎么衔接的。像这种问题,如果只靠通用模型,就特别容易瞎编。

2022年,是ChatGPT出来的那一年,也是AI开始大规模往互联网上灌内容的分水岭。在那之前,不管是书还是数据,相对来说更干净,是真人写的、真事采的,没有被大规模AI生成内容混进去。而在那之后,网上越来越多东西是AI产的,真假难辨,喂给模型还可能把模型自己带沟里去。

所以现在真正稀缺的,就是那批干净的、未被污染的、带着真实行业洞察的专有数据。

范蠡4.0那三十年的鱼塘数据,收书人抢的旧书,说到底,都是类似的这种东西。底座平权的时代,大家的起跑线越来越接近,胜负手全在上面那一层,就看你手里有没有一份别人搞不到的、脏不了的专有数据和标准。

写到这儿,我突然有个想法,想跟你说说。我们聊范蠡4.0、聊养鱼、聊3970亿参数,看起来好像离咱们普通人挺远的。但你把这个逻辑抽出来看,它其实特别近。

每个人身边,可能都藏着这么一个小小的复利领域,一条别人看不见的护城河。

可能是你干了十年的那个特别细分的活儿,攒下来一肚子只有你知道的门道;可能是你为了带孩子、为了照顾家里,摸索出来的一套别人复制不了的经验;也可能,就是你一直在记的某种东西,比如一堆你自己都没太当回事的笔记、录音、日记。

在过去,它们可能就是散落在角落里,激活不了,用不上。但在AI底座越来越强的今天,这些原本沉睡的、独属于你的积累,突然就有了一个能把它激活的引擎。三十年的鱼塘能等到范蠡大模型4.0,你那一份不起眼的积累,说不定也在等一个属于它的时刻。

所以,不妨留意一下,你手里那份别人拿不走的东西,到底是什么。那可能就是接下来这几年,最有价值的东西。

 
我要回應
我的稱呼
回應 / 意見
驗証文字