梁文锋投资者交流会:愿景、开源、AGI 与中国算力
资料说明:本文依据 PDF《梁文锋投资者交流会-文字稿(庞通整理)》编辑。原文件标注全文约 3.5 万字、由庞通使用 AI 整理;未注明会议日期、主办方与完整参会人信息,也不是经公司确认的正式逐字稿。本文删去了口语重复、转写错漏以及现场明确提示不要外传的卡量、采购金额和未发布模型参数等敏感数字。文中的公司状况、技术判断与时间预期均来自这份材料,未作独立核验,不应视为 DeepSeek 的正式披露或承诺。
先给结论:这不是一场产品发布会,而是一套关于“怎样做成 AGI”的自我解释
这场近四小时的交流,表面上谈到了 API 定价、开源模型、To B 收入、国产芯片、数据标注和下一代模型,真正贯穿始终的却是三个词:愿景、克制、持续学习。
梁文锋试图解释,DeepSeek 为什么选择开源、为什么不急于扩张产品线、为什么把团队稳定看得高于短期收入,以及为什么认为当前大模型距离 AGI 的关键缺口不是再做一个聊天产品,而是让模型能够在真实环境中长期学习。
如果把全文压缩成十条判断,大致是:
- 公司不是靠 KPI 组织起来的,愿景必须体现在真实取舍中,而不是写在墙上。
- “克制”既是价值观,也是战略:少拿一部分短期利益,可能提高长期做成 AGI 的概率。
- 在 AI 这样足够大的市场里,开源与商业化并不必然冲突,真正的壁垒仍包括训练、部署和成本工程。
- C 端产品与 API 业务不是终点,而是通往 AGI 过程中自然产生的阶段性成果。
- 当前模型在上下文完整、任务明确时已经很强,但不能像员工一样通过几个月工作形成持续记忆,这是它难以真正进入组织的根本限制。
- 他设想的技术阶梯是:语言模型、思维链、Agent、持续学习、自我迭代,最后才是具身智能。
- 公司最不能退让的“核心利益”不是某一块市场,而是核心团队的稳定。
- 组织同时保留自上而下的协作和自下而上的自由探索;正式任务不应占满研究人员的全部时间。
- 中国与美国前沿模型的主要差距被归因于算力资源,人才、模型能力和应用差距在很大程度上都是它的后果。
- 大模型长期竞争的差别主要落在成本、时间和用户体验,基础模型公司也会从当前的分散状态逐渐收敛。
一、愿景不是标语,而是公司愿意放弃什么
交流一开始,梁文锋没有先讲收入和模型,而是花了很长时间解释公司的出发点。他反复强调,早期团队并不是因为上市、资本市场或个人财富而聚在一起,而是相信人工智能是一件对社会有用、值得长期投入的事。
他对“愿景”的定义很具体:
愿景不是挂在墙上的标语,愿景是你怎么做,不是怎么说。
换句话说,愿景要由日常决策反向证明。如果公司声称推动技术普及,却把模型能力封闭起来、把价格定在利润最高点;如果公司声称追求 AGI,却把主要资源投入短期流量和广告,那么真正起作用的愿景就不是前者。
由此引出交流中出现频率最高的另一个词:克制。它至少包含四层意思:
- 不把利润最大化当作每一次定价的出发点,只获取足以维持长期研发的合理回报;
- 不因为已经有了 C 端用户,就立刻转向流量、广告、电商或超级 App;
- 不把产业链上下游都纳入自己的边界,给合作伙伴保留应用和商业化空间;
- 不把开源视为获客手段,而把它作为公司愿景和长期技术路线的一部分。
这并不是说商业无关紧要。梁文锋也明确承认,公司不是研究机构,最终必须依靠收入活下去;API、To B 和 C 端业务都要做好。区别在于,商业化首先承担的是维持研发和组织运转的任务,而不是反过来决定研究方向。
这套逻辑可以概括为:公司要赚钱,但不需要在每一个阶段、每一个环节赚最多的钱。
二、为什么他认为开源和商业化可以共存
传统软件的复制成本很低,一旦核心代码开源,授权收入往往会直接承压。但在梁文锋看来,大模型并不完全遵循这套逻辑。模型权重只是整个系统的一部分,把同一模型稳定、低成本地部署成服务,仍然需要大量工程优化、基础设施和组织能力。
交流中,他表示开源模型与自营服务会保持一致,不打算通过“开源较弱版本、自己保留更强版本”来制造差异。其商业判断是:只要 API 定价维持合理利润,并把推理成本做得足够低,第三方即使拿到模型,也未必能以同样成本提供同等质量的服务。
因此,开源在这里同时承担三种角色:
- 人才与组织机制。清晰的开放立场可以凝聚愿意做长期技术的人,也让内部成员感到工作成果真正被社会使用。
- 产业协作方式。基础模型团队不可能独自完成所有行业应用,开源让更多伙伴能够把模型带进生产环境。
- 商业竞争策略。开放权重降低了模型被垄断的可能,却不自动抹平训练效率、部署成本、产品体验和迭代时间的差距。
他并不担心合作伙伴或竞争者部署 DeepSeek,甚至愿意帮助对方复现;真正担心的是部署错误导致效果下降,或生态没有建立起来。
这也解释了为什么他把 C 端和 B 端称为 AGI 路上的“副产品”。模型研发原本就要经过一个个能力台阶,已经形成的阶段性能力可以顺手提供给用户,并产生现金流;团队不必为了某个商业场景重新定义公司的技术目标。
这种做法当然存在张力。开源是否持续、定价中的“合理利润”如何定义、收入规模能否覆盖越来越昂贵的前沿研究,都需要在现实经营中反复验证。文字稿给出的更多是一套原则,而不是完整财务模型。
三、从语言模型到具身智能:持续学习为什么是关键台阶
全文最重要的技术判断,是把持续学习放在 Agent 之后、具身智能之前。
梁文锋认为,今天的模型有一个常被忽略的前提:只要问题描述清楚,并获得完整上下文,它在许多局部任务中已经可以超过人类。但现实组织不可能每次都把全部背景重新写进提示词。一个新员工工作两个月后,会自然知道“小王”是谁、团队如何协作、哪些惯例没有写进制度;当前模型却没有同等稳定的长期学习过程。
因此,能力演进不是简单地把上下文窗口做得更长,而是一系列彼此依赖的台阶:
- 语言模型提供基本的知识表达和生成能力;
- 思维链(CoT)让模型能够在一次任务内部展开推理;
- Agent让模型调用工具、分解步骤并完成更长的任务;
- 持续学习让模型在长期环境中积累经验、更新自身,而不是每次从近似静态的状态重新开始;
- 自我迭代让 AI 参与下一代 AI 的研究和开发,使进步从线性变成非线性;
- 具身智能再把已经成熟的智能带入现实世界,处理家务、照护和其他具体人力需求。
这是一条带有鲜明工程偏好的路线:先解决能够放大研发效率的问题,再让前一阶段的 AI 帮助完成后一阶段,从而减少数据和人力密集的工作。
他也明确承认,持续学习目前还没有公认、成熟的方法。它不是一个可以按计划交付的单项功能,而是一组仍在探索中的算法与工程问题。公司可以让很多研究者低成本尝试想法,却不能保证谁、在什么时候“摸到”真正有效的方法。
由此看,“下一代模型”的分界线也不应只是版本号、参数量或榜单分数。在这套叙事里,成本更低、速度更快、效果更好仍然只是连续改进;只有获得有效的持续学习能力,才算跨上新的技术台阶。
四、哪些是主线,哪些只是组件
交流中另一个反复出现的区分,是提高智能上限的主线与改善产品能力的组件。
多模态、搜索都被归入组件:它们对产品很重要,也会做,但不是当前研究主线本身。视频生成被视为可能成立的商业方向,却未必直接提高通用智能上限;“世界模型”概念过于宽泛,在现阶段也没有被放在持续学习之前。
这并不是否定多模态或具身智能,而是研究顺序的选择:先把训练和学习机制做好,再让已有智能进入更多模态和现实环境。梁文锋认为,如果顺序反过来,团队会过早承担大量工程和数据工作,研发会变得更重。
他仍然相信 Scaling。按照文字稿中的表述,团队尚未在自己的资源尺度上看到模型规模和数据规模的明确上限;限制继续扩展的首先是算力,而不是已经证明 Scaling 失效。模型规模也不是由“够不够聪明”倒推出来的,而是由现有资源能负担多大规模决定的。
关于其他常见问题,交流中还给出了几个较简洁的判断:
- 幻觉可以通过更好的后训练继续改善,但目前更接近产品问题,不是技术主线的最高优先级;
- 数据的作用接近模型的一半,高质量标注既昂贵又需要时间,不能只靠一次增加资本投入解决;
- 让新模型首先帮助 DeepSeek 自己开发下一代模型,比单纯追求外部评测更接近 AGI 目标;
- 当前更值得优先做的是通用 Agent,尤其是 Coding Agent,而不是立即铺开金融、法律、医疗等所有垂直产品。
这些判断都应当理解为团队的路线选择,而不是行业共识。尤其是持续学习、世界模型、具身智能之间的先后关系,仍是全球研究者争论最激烈的问题之一。
五、“没有组织”的背后,其实是一套双轨组织
梁文锋说公司“没有组织”“没有 KPI”,但全文给出的实际情况并不是完全自由放任,而是一种双轨结构。
第一条轨道是自上而下的正式协作。当公司要训练或发布一个大版本时,必须统一目标、明确分工,由不同成员完成系统中的一部分。
第二条轨道是自下而上的自主研究。研究人员保留相当一部分不被安排的时间,可以根据自己的判断探索问题;如果所需资源很少,甚至不必经过复杂协调。
他给出的理想边界是,正式任务不要占满研究人员的时间,最好只占一部分,其余时间留给自由探索。较少加班也不只是福利政策,而是两种选择的结果:研究需要松弛环境,公司足够聚焦,需要同时推进的事情就比较少。
决策方式同样强调共识。梁文锋把自己的内部权威描述为共识的结果,而不是可以绕过共识直接推动任何事情的职位权力。愿景的作用,是让聪明人愿意长期合作,而不只是把人才招进同一栋楼。
在这套组织观里,唯一不能轻易让步的核心利益是团队稳定。资金、算力和其他资源都可以继续获取,某次技术挫折也只会让进度延后;如果核心团队能够保持稳定,失败后还可以继续尝试。反过来,一旦组织失去共同目标,即使资源充足也未必能把研究做成。
不过,梁文锋也承认这种结构会遇到规模边界。随着人员增加,一些需要稳定交付和跨团队协调的部门必须建立更严谨的层级,另一些研究部门则继续保持扁平。未来的组织不太可能简单复制早期几十人的状态,而会变成不同管理方式并存。
六、中美差距:先是算力差距,然后扩散为其他差距
对于中国与美国前沿 AI 的差距,梁文锋给出了一个非常集中的解释:主要瓶颈是资源。
人才并非天然缺失,但算力少意味着研究者能够做的实验更少,能承受的模型规模更小,人才培养和工程经验也会随之落后。因此,最终看到的人才差距、模型差距和应用差距,很多都是算力资源差距向下游传导的结果。
在全面算力仍有数量级差距时,他不认为中国团队可以在所有方向上同时超过美国。更现实的策略是:
- 接受模型规模更小或时间暂时落后;
- 用更高的训练与推理效率减少单位能力所需算力;
- 在少数重点方向集中资源,争取局部领先;
- 等待国产硬件生态和产能逐步成熟,再扩大可研究的模型尺度。
这也是 DeepSeek 为什么格外重视成本。低成本不仅让用户更容易使用,也让团队在相同算力下训练更大的模型、做更多实验。对资源有限的团队而言,效率不是商业包装,而是研究能力的一部分。
七、国产芯片的机会:生态问题可能先解决,产能问题更慢
文字稿对国产 AI 芯片的判断总体乐观,但把问题拆成了两层。
第一层是软件生态。过去国产卡难用,往往不只因为硬件性能,还因为 CUDA 已经积累了庞大的算子、工具链和开发习惯。梁文锋认为,AI 辅助编程和 TileLang 一类更高层的编程工具,使重建算子和迁移生态的成本显著下降。团队已经在尝试弱化对 CUDA 生态的依赖,再把同一套方法迁移到其他硬件。
第二层是硬件产能与代际差距。即使软件适配完成,能够获得多少先进芯片、以什么成本形成大规模稳定集群,仍然需要更长时间解决。生态建立可以靠集中工程投入加速,晶圆、封装、内存、互联和整机产能却不能同样快地复制。
因此,更准确的结论不是“国产卡已经不存在问题”,而是:生态障碍正在变得更可解,产能可能成为更长期、更硬的约束。
交流中还表达了一个不愿轻易纵向整合的态度。DeepSeek 会自建集群,但是否自研芯片要看收益;如果能以合理价格买到合适硬件,就没有必要为了“全栈”而造芯片。基础模型、芯片、行业应用和终端产品都可能诞生大型公司,不需要由同一家公司全部完成。
八、大模型终局:成本、时间与体验
梁文锋认为,当基础能力逐渐收敛后,模型公司的长期差距主要会落在三件事上:
- 成本:以多低的训练和推理成本提供同等质量服务;
- 时间:同一代能力能提前多久做出来、迭代有多快;
- 体验:产品细节、响应速度和用户习惯形成的有限壁垒。
其中前两项更加本质。只比较模型效果而忽略成本,就像拿不同价位的汽车直接比较;只有在相近服务成本下,能力对比才具有商业意义。
这也决定了他对行业结构的判断。当前中国做基础模型的团队很多,资金和算力分散在重复工作上;随着利润率回到合理区间,市场会逐步收敛到少数几家。基础模型公司不会拿走 AI 产业的大部分利润,更多价值会由使用模型解决具体问题的企业分享。
中国公司的结构性机会,可能首先出现在成本和产品:通过工程与供应链把能力做得更便宜,再依靠成熟的互联网产品经验改善用户体验。在全球分工中,中国 AI 未必需要复制美国公司的全部路线,也可能扮演高效率、大规模供给者。
九、如何读这份文字稿:观点比数字更重要
这份材料信息量很大,却不适合当作一份精确的公司公告来读。
首先,原稿是录音转写后的 AI 整理版,存在明显断句、同音词和英文缩写识别问题,个别问答也有缺句。其次,交流中的模型进度、硬件判断和行业预测具有很强时点性,今天的主观判断不等于未来承诺。再次,主持人在现场明确提醒不要传播部分具体数字,因此这些内容不应因为出现在转写 PDF 中就被当成可公开披露的信息。
真正值得保留的是一套相互咬合的逻辑:
- 战略上克制,不急于吃下所有短期商业机会;
- 技术上激进,继续相信 Scaling,并把持续学习当作下一个关键突破;
- 组织上松弛,用愿景、共识和自由研究时间维持长期创造力;
- 工程上务实,承认算力差距,通过成本效率和国产生态寻找可行路径;
- 商业上留有底线,公司必须能活下去,但收入服务于长期目标,而不是替代长期目标。
这套路线能否一直成立,最终要看几个尚未解决的问题:持续学习能否真正突破;开放权重与低价服务能否长期覆盖前沿研发成本;团队扩大后,共识驱动是否还能保持效率;国产算力的产能能否赶上模型规模增长。
交流会没有给出这些问题的答案。它更像是在说明,DeepSeek 选择用什么次序寻找答案。
十、如果只记住三句话
技术上:当前模型不只缺更长的上下文,更缺在真实环境中长期积累经验的能力;持续学习是这套 AGI 路线的下一道门。
组织上:核心团队的稳定比某一块短期市场更重要,愿景的作用是让人才愿意一起穿过失败和波动。
战略上:克制不是放弃商业,而是决定哪些钱现在赚、哪些能力自己做、哪些机会留给生态,以此换取更长的技术时间。
评论