“大模型技术在商业影响力和大众关注度上可能占了当前的 90% 以上,但在科学理论与技术谱系的集合中,它只是现代计算机科学冰山水面上的一个小尖角,占比远低于 1%。”
这些天打开各大社交平台和科技资讯,满眼都是“大模型”、“Token”、“千亿参数”以及“人类即将失业”的惊叹号。看着这架势,不明真相的吃瓜群众还以为计算机科学这棵参天大树被连根拔起,只剩下一根插满服务器散热风扇的巨型大模型网线了。每当深夜加班敲着底层指针、和诡异的内存泄漏死磕时,我常常端起保温杯看着屏幕发呆:我和计算机这数十年的缠绵爱情里,大模型究竟占了百分之几?
要回答这个问题,我们不妨把浪漫的荷尔蒙暂时收一收,掏出计算机系老学长最爱用的集合论和集合包含关系(Venn Diagram)来量一量。如果我们把现代计算机科学(CS)看作一片浩瀚无垠的宇宙,那么今天出尽风头的大模型(LLM),在数学和理论的严格谱系里,其实连 1% 的微小份额都不到。
一、集合论视角:大模型在计算机科学里的真实体量
我们可以用包含关系(Subset)来做一次毫不留情的“降维打击”。把一切现代可计算性问题的母体——图灵机与现代计算机(Turing Machine)看作全集 $U$。在这个全集里面,人工智能(AI)只是其中一个温驯的小分支;再往里缩小,数据驱动的机器学习(ML)又是 AI 的真子集;而基于多层神经网络的深度学习(DL),则是 ML 里面的弄潮儿。
至于我们今天挂在嘴边、吸走无数融资和眼球的大模型(LLM/Foundation Models),严格来说,它只是深度学习在当下一个极其耀眼、但也极其单一的变体——绝大部分大模型目前几乎全部垄断在 Transformer 这一种架构的变体上。如果把计算机科学按一级学科和理论厚度来切分:网络安全、数据库、操作系统、编译原理、图形学、分布式网络、量子计算……每一个都是重峦叠嶂。大模型虽然在商业新闻里吃掉了 90% 的热度,但在严谨的理论定理库与经典计算机科学的浩瀚江山里,它大概率只是一粒微不足道的沙子,占比甚至不到 0.1%。
这并不是在贬低大模型的伟大,而是一种基于第一性原理的清醒认知。正如通信史上从 1G 演进到 6G,模拟通信、电路交换这些曾经喧嚣一时的浪花最终都化作了河床底部的历史尘埃;而诸如“调制与编码”、“多路复用”以及电磁波的物理特性这类数理公理,却成了贯穿六代通信不变的“守望者”。大模型很像通信史上的全 IP 化或者数字蜂窝网络,它完成了一次伟大的彻底启蒙,但它绝对不是计算机科学这条长河的终点站。
二、精神交织:当算法热潮退去,谁才是真爱?
既然从集合论的角度来看,大模型只占了计算机科学的“冰山一角”,那么为什么我们在日常恋爱(啊不,是日常搬砖)中,总觉得它无处不在呢?
我们倾向于认为,这其实是一种典型的“聚光灯效应”。在风口正盛的时候,大众往往容易把商业流量的 90% 直接等同于科学真理的 100%。但真正的老程序员和硬核工程师心里跟明镜似的:你和计算机谈恋爱,天天指望靠大模型那充满概率性、甚至时不时“一本正经胡说八道”的幻觉来度日,迟早得在某次生产环境的内存崩溃中分道扬镳。
真正支撑我们与硅基世界日夜厮守、至死不渝的真爱,其实是那些枯燥、稳定、甚至有点不近人情的东西。比如操作系统对硬件的精准抽象、比如编译原理里不容半点含糊的语法树检查、比如分布式网络中历经千锤百炼的 Paxos/Raft 一致性协议。这些东西没有一句甜言蜜语,也不具备什么涌现能力,它们冷酷、确定、雷打不动。正是有了这些底层的“守望者”,大模型那些飘浮在云端的、动辄千亿参数的概率生成,才有了安身立命的物理沙箱和算力基石。
如果把人工智能比作一条流淌百年的长河(从1956年达特茅斯会议算起),大模型大概在2020年前后才真正汇入主航道。在未来的几十年里,它或许会经历汛期的狂飙,也终将在三十年后沉淀为无处不在的“基础设施”(就像今天的电力和TCP/IP协议一样),化作长河底部的河床。它很重要,但它不是全部。
三、工程师的浪漫:在噪声中坚守第一性原理
所以,回到最初那个有点调侃的问题:我与计算机的爱情里,大模型究竟占百分之几?
如果按朋友圈的截图率来算,它占了 99%;但如果按我们对系统确定性的热爱、对底层代码洁癖的追求以及对第一性原理的笃信来算,大模型大概只占了我们心智画布上的一抹亮色,而那片广袤、深邃、由无数经典逻辑交织而成的星辰大海,依然留给图灵机、分布式系统和我们亲手敲下的每一行严谨代码。
我们并不排斥大模型,恰恰相反,我们正在端侧用硬核的系统工程去驯服它、规训它,让它摆脱云端大厂的算力垄断,真正变成每一个普通人都能握在手里的“本地离线数据安全屋”与思维拐杖。但这并不意味着我们要被算法狂热所驯化。
在充满噪声与概率幻觉的时代周期里,保持清醒的理性,分清哪些是转瞬即逝的浪花,哪些是历久弥新的磐石,大概率是一个硬核工科生与计算机谈一场长久恋爱时,最浪漫的自我修养。
- 1. 【集合论引论】阿兰·图灵:《论可计算数及其在判定问题中的应用》,现代计算机科学与可计算性理论的奠基石。
- 2. 【行业洞察】斯坦福大学:《2025年人工智能指数报告》(The 2025 AI Index Report | Stanford HAI),关于人工智能在计算机科学文献及产业研发预算中的结构性占比分析。
- 3. 【系统思维】罗伯特·C. 马丁:《敏捷整洁之道:回归本源》,探讨软件工程本源与代码确定性执行流的经典著作。
- 4. 【专栏指引】辛巴达智能(Sinbad AI)技术白皮书与研发手记,关于“本地优先(Local-First)”架构与端侧认知计算引擎的工程哲学。