Share E-Book

DeepSeek:打开财富密码 (陈根)(Z-Library)

Author 陈根

Other
Language Chinese

2025年春节,中国AI黑马DeepSeek汇聚全球目光。本书全面解析了DeepSeek的崛起历程、技术突破及其对AI行业的深远影响;介绍了DeepSeek相关应用方法,包括优化交互方式、调用API服务、本地部署模型等;分析了DeepSeek即将引发的行业变革,以及其AI能力在垂直行业领域的应用。

Format PDF
Size 11.3 MB
9
Views
0
Downloads
0.00
Total Donations
(First 20 pages)

Registered users can read the full content for free

Register as a Gaohf Library member to read the complete e-book online for free and enjoy a better reading experience.

Page 1
(This page has no text content)
Page 2
1 内容简介 本书全面解析了DeepSeek的崛起历程、技术突破及其对AI行业的深远影响。全书 共6章,第1章追溯DeepSeek的起源与发展,展示其从初创到全球爆火的历程;第2 章通过“AI领域拼多多”的比喻,分析其低成本、高性能的商业化路径,并深入 探讨其核心技术;第3章介绍相关应用方法,包括优化交互方式、调用API服务、 本地部署模型等;第4章、第5章分别分析DeepSeek引发的行业变革,以及其AI能 力在垂直行业领域的应用前景;第6章剖析AI行业发展中的挑战与机遇,为未来AI 行业发展提供思考方向。 本书适合希望拥抱AI时代、借助AI技术实现突破与超越的各界读者阅读。
Page 3
2 前言 2025年注定是不平凡的一年。 2025年伊始,DeepSeek(深度求索)的AI模型和春节档电影《哪吒之魔童闹海》 (以下简称《哪吒2》)横空出世,迅速成为各自领域的现象级作品,成功破圈, 让中国在科技与文化两个领域接连震撼整个世界。 《哪吒2》自1月29日春节档上映以来,票房一路高歌猛进,不仅跻身全球影史票 房榜TOP10,更是登顶全球动画电影票房榜。 DeepSeek则是在人工智能这一前沿科技领域让世界看到中国力量。DeepSeek发布 的DeepSeek-R1模型,在全球知名AI模型评测平台Chatbot Arena上,基准测试排 名升至全类别大模型第三,在风格控制类模型分类中与OpenAI o1并列第一;其应 用登顶苹果应用商店中国地区和美国地区免费App下载排行榜,成为全球用户增速 最快的AI应用。 DeepSeek甚至凭一己之力,引发美股震荡。DeepSeek通过混合专家模型、多头潜 在注意力机制、强化学习等技术创新,显著降低了模型训练和推理的算力消耗, 因而引发了市场对算力重要性的怀疑。受此影响,美国科技巨头股价集体大跌, 当地时间1月27日,英伟达股价暴跌约17%,博通股价下跌17%,超威半导体股价下 跌6%,微软股价下跌2%,就连比特币等虚拟货币也未能幸免,价格随之下跌。 DeepSeek真的有这么牛吗?我可以很明确地说,是的。DeepSeek的颠覆性主要体 现在两个方面: 一方面,DeepSeek以极低的成本打破了美国科技巨头在AI领域的垄断。要知道, AI的发展向来是一场围绕算力、算法和数据的竞赛。在OpenAI、谷歌、Anthropic 等企业的统治下,市场普遍认为,要想打造一个足够强大的AI模型,就需要投入 海量的算力和资金。这也导致这几年AI产业一直在向寡头化演进。但就在所有人 都以为AI赛道已经固化的时候,DeepSeek横空出世,打破了这一认知。其模型以 极高的性价比和强大的性能在全球AI竞赛中杀出重围,也让世界看到了AI领域的 中国力量。 另一方面,DeepSeek开创了一种全新的AI发展模式——开源+轻量化,进而改写了 AI产业的竞争格局。DeepSeek的崛起,并不仅仅是一个新AI企业的崭露头角,而 是一次商业模式、技术路径和行业应用方式的重大变革。
Page 4
3 DeepSeek选择了一条与传统大模型完全不同的发展路径,它没有追求超大规模的 参数,而是通过轻量化的AI解决方案,让AI在更低的计算资源下运行,使AI真正 普及化。它不仅让AI服务变得更便宜,还开放了模型源代码,让所有开发者都能 在其基础上构建自己的AI模型,这种模式将颠覆AI产业现有的封闭体系。 无论是个人,还是行业,都会因为DeepSeek的开源及其简易的本地部署方式与可 及的专属训练空间而受益。人人拥有AI助手的时代因此提前到来。换言之, DeepSeek使我们看到了AI让个体能力提升,让AI应用进入千行百业,落地赋能社 会,打开万亿级市场的真正可能。 站在个体角度上,过去,AI技术往往掌握在大企业手中,普通人想使用AI,通常 只能依赖封闭平台。而DeepSeek的开源+轻量化AI模式,允许任何人进行个性化的 AI模型微调,这彻底改变了当前AI产业的商业模式。现在,AI不再神秘,变得人 人可用,人人可调,人人可受益。 DeepSeek允许任何个体或企业在本地部署AI,并通过微调训练使其适应自己的需 求。这意味着,个人能力可以借助AI成倍提升:一个普通的上班族,可以通过 DeepSeek提高写作、编程和数据分析的效率;一个自由职业者,可以用DeepSeek 快速生成商业计划书,优化社交媒体内容,甚至完成法律文书的撰写。就连知识 主播和直播带货达人,都可以利用自己所在领域的独有数据对DeepSeek模型进行 针对性的训练,以打造一个属于自己的AI数字孪生人。 DeepSeek让AI不再只是科技巨头的生产力工具,更成为个体崛起的智能助手。未 来的人类将分成两种——会用AI的人与不会用AI的人,二者之间的差距将随着AI 的普及而越来越大。 如果说DeepSeek提升了个体的生产力,那么它对行业的影响更是颠覆性的。AI的 真正价值,不仅在于它的技术突破,更在于它在千行百业中的应用,为社会创造 了实实在在的价值。DeepSeek以轻量化AI的模式,让AI应用的成本大幅降低,使 得它可以深入每一个行业,推动生产力的大幅提升。 在医疗行业,本地部署的DeepSeek模型可以用来辅助医生进行医学影像分析,提 高疾病筛查的效率,甚至可以作为医生的智能助手,帮助整理病历、生成诊断报 告,让医疗服务更加精准和普惠。 在金融行业,DeepSeek能够快速分析海量市场数据,预测经济趋势,优化投资策 略,甚至可以帮助银行和保险公司自动处理合规报告,降低运营成本。 在法律行业,DeepSeek已经展现出了巨大的潜力,它可以进行智能合同审查、自 动化法条检索,甚至为法官提供案件判决参考,大幅提升司法效率。
Page 5
4 在教育行业,DeepSeek使个性化教学成为可能,学生可以借助AI进行智能问答, 教师可以用AI辅助备课和批改作业,让教育资源更加公平和高效。 这些行业的市场规模都足够庞大,AI的深度渗透将催生出全新的商业模式,推动 AI产业进入真正的万亿级市场。 未来,AI竞争将不再是少数几家头部企业的烧钱游戏,无数中小企业、开发者、 科研机构都有机会参与AI产业发展。这也让全球AI行业进入了一个全新的阶段 ——竞争的焦点不再仅仅是“谁的AI模型更大更强”,而是“谁能更好地将AI赋 能行业和实际应用”。DeepSeek的开源策略,让全球AI生态系统迎来了更加开放 和去中心化的发展方向,这不仅为中国AI产业提供了突围机会,也让AI发展真正 进入“普惠时代”。 当然,这不是让大家盲目崇拜DeepSeek,而是要理性地看待DeepSeek的突破和价 值。只有客观,才能真正把握新一波AI浪潮的机遇,包括如何真正善用AI,以及 如何通过DeepSeek赋能各项任务,赋能行业。 事实上,AI产业每天都有让人眼前一亮的进展,DeepSeek的成功是昙花一现还是 “哪吒降世”依然需要时间来验证。并且,虽然DeepSeek成功地把AI应用的成本 打下来了,但算力仍然是制约AI发展的重要因素。没有算力,就不可能实现AI落 地应用。 除了算力,DeepSeek及整个AI产业还要面对许多新的挑战,比如,DeepSeek带来 开源AI的兴起,让AI监管变得更加复杂,本地部署的AI使传统的云端监管体系失 效。随着DeepSeek模型的大规模应用,如何确保AI的合规性、如何防范AI被滥 用、如何建立新的AI监管机制,都是未来必须面对的问题。同时,AI模型训练对 高质量数据的需求激增,促使全球科技公司开始抢占数据资源,如何获得高质量 的大数据将是接下来AI产业发展的新竞争点。未来,随着AI需求的增长,数据的 获取和管理将成为新的瓶颈,AI产业也将进入一个全新的竞争阶段。 本书的写作目的,就是尽可能地向大家全面解析DeepSeek及其影响。同时,在这 个AI私人定制时代,教会大家如何借助DeepSeek模型实现本地部署、开展本地应 用。让所有人,都可以低成本地基于DeepSeek模型来打造一个自己的专属AI。 我将从多个角度深入剖析DeepSeek的发展历程、技术原理、应用方法:向大家介 绍DeepSeek从诞生到爆火的全过程;讨论DeepSeek如何用低成本、高性能的方式 让AI真正普及化,并剖析其背后的技术原理;详细介绍如何使用DeepSeek,包括 优化AI交互、打造私人AI助手等,让读者能够真正上手并利用DeepSeek赋能自己
Page 6
5 的业务。在本书的后半部分,我还将和大家一起讨论DeepSeek如何改变AI产业的 商业模式,分析DeepSeek在医疗、金融、法律、教育、科研、创作、电商、设 计、交通、制造等行业的实际应用。本书文字表达通俗易懂,内容深入浅出、循 序渐进,无论你是对DeepSeek感兴趣的大众读者,还是深耕相关领域的专业人 士,希望这本书都能帮助你深入了解突然爆火的DeepSeek以及DeepSeek对未来产 生的影响和冲击,并启发你思考AI在未来的无限可能。 陈根 2025年2月
Page 7
6 第1章 DeepSeek的前世今生 1.1 干翻GPT,DeepSeek爆火出圈 DeepSeek彻底火了——2025年一开年,被宣传“干翻GPT”的DeepSeek几乎成为全 世界科技圈唯一热议的焦点。 自2023年春节被OpenAI的ChatGPT引爆以来,人工智能这一话题在2024年春节依然 火热,那时围绕的是OpenAI的Sora,而进入2025年春节,出现了变与不变。不变的 是,这个春节依然被人工智能所点燃,而变的是,这次的焦点由美国的科技公司变 为了中国的科技公司。(此书更多分享搜索@雅书B) DeepSeek的火爆程度超乎想象。美国当地时间1月27日,纳斯达克指数出现3%的下 跌,市场分析认为,原因就是中国人工智能初创公司DeepSeek的最新突破,引发了 美国投资者的关注,DeepSeek甚至被认为动摇了美国科技行业的“无敌”地位。 具体而言,1月27日当日,美国芯片巨头英伟达(NVIDIA)股价暴跌约17%,半导体 公司博通(Broadcom)股价下跌17%,超威半导体公司(AMD)股价下跌6%,微软股 价下跌2%。此外,人工智能领域的关联行业企业,如电力供应商的股价也受到重 创,美国联合能源公司股价下跌21%,Vistra股价下跌29%。 而与此同时,DeepSeek应用登顶15个国家和地区的苹果应用商店免费App下载排行 榜,超越了ChatGPT及Meta、谷歌、微软等公司的生成式AI产品。 面对突然出圈的DeepSeek,很多人最好奇的问题就是:这个DeepSeek到底是什么? 为什么突然这么火? DeepSeek是一家中国人工智能公司,全称是杭州深度求索人工智能基础技术研究有 限公司,由著名量化私募幻方量化支持。幻方量化以其雄厚的资金实力,为 DeepSeek提供了强大的资金支持。 2023年11月29日,DeepSeek发布了通用大模型DeepSeek LLM。不过,当时市面上已 经有GPT-4、Claude-3.5、Gemini等国际顶尖模型,甚至在国内曾经的“百模大 战”中,它都属于不起眼的小角色。因此,DeepSeek LLM的出现并未在市场上引起 太多关注。
Page 8
7 让DeepSeek引发关注的,是五个月后的DeepSeek-V2。2024年5月7日,DeepSeek-V2 发布,一发布就开源。 在中文综合能力评测AlignBench中,DeepSeek-V2成为最强的开源模型,甚至与 GPT-4 Turbo、文心4.0等闭源模型处于同一梯队。而在英文评测MT-Bench中,它与 当时最强的开源模型Llama3-70B不相上下,甚至超越了Mixtral-8×22B等混合专家 模型。在知识、数学、推理、编程等多个领域,DeepSeek-V2也都排名前列。更重 要的是,它的API价格只有GPT-4o的2.7%,这直接引爆了国内大模型的价格战,字 节、阿里、百度、腾讯全部跟进降价。 而这只是DeepSeek掀起的第一波风暴。2024年12月26日,DeepSeek-V3发布,再次 开源,它的性能比V2版本更进一步,直接挑战国际闭源大模型。无论是知识类任 务、长文本理解、编程能力,还是数学运算,DeepSeek-V3的表现都已经接近甚至 超越了GPT-4o、Claude-3.5-Sonnet等顶级闭源大模型。更令人震撼的是,它的训 练成本竟然只有557.6万美元,远低于大厂动辄上亿美元的训练开支。这次亮相让 DeepSeek的名字开始在海外科技社区疯狂刷屏,众多AI研究者和开发者争相测试。 如果说DeepSeek-V3让DeepSeek在全球AI行业站稳了脚跟,那么2025年1月20日发布 的DeepSeek-R1,就让DeepSeek真正走上了神坛。 DeepSeek-R1——一个推理能力媲美OpenAI o1的模型,但API价格仅为o1的3.7%。 可以说,DeepSeek再次用低价策略冲击了市场,让整个AI行业再次颤动。短短几 天,DeepSeek的影响力就突破了AI技术圈,甚至影响到了资本市场。1月27日, DeepSeek应用同时登顶苹果应用商店中美两区免费App下载排行榜,超越长期霸榜 的ChatGPT,投资者开始动摇,英伟达股价大跌。从这个时候开始,DeepSeek彻底 火遍全网,被各大媒体争相报道。 1.2 这么火,DeepSeek凭什么 DeepSeek的爆火,既是意料之外,又是情理之中,因为DeepSeek确实太厉害了。 DeepSeek的厉害,至少体现在三方面:性能、成本、开源模式。 1.2.1 超级强悍的性能,谁都能打 DeepSeek-R1的横空出世,让不少AI研究者和开发者都大为震惊。根据测试结果, 这款大模型在数学、编程和推理任务上的表现已经达到甚至在部分情况下超越了o1 的水平(见图1)。要知道,o1可是OpenAI最新推出的旗舰模型,代表着当前世界
Page 9
8 最先进的AI技术之一。DeepSeek-R1作为一个国内研发的大模型,竟然能在部分任 务上正面对抗o1,甚至在个别测试中更胜一筹,这无疑是一个巨大的突破。 图1 DeepSeek各版本模型与o1模型在不同基准测试中的表现对比 当然,有人可能会怀疑,DeepSeek-R1是不是在这些特定任务上做过针对性优化, 从而在跑分上取得了好看的成绩。但毋庸置疑的是,用户的真实体验给出了最具说 服力的证明。在X(原推特)、微博、小红书等社交平台上,大量开发者和普通用 户纷纷给出实测评价。DeepSeek-R1的能力,尤其是编程能力,在某些场景下确实 优于o1。这不仅仅是测试数据的结果,更是大量用户在实际应用中的反馈。 而真正震动整个科技圈的是硅谷的科技巨头与人工智能科学家的关注,2025年1月 27日,据Information网站报道,脸书母公司Meta成立了四个专门小组来研究 DeepSeek应用的工作原理,并基于此来改进旗下的Llama大模型。 其中,两个小组正在试图了解DeepSeek如何降低训练和运行大模型的成本;第三个 小组则正在研究DeepSeek可能使用了哪些数据来训练模型;第四个小组正在考虑基
Page 10
9 于DeepSeek模型属性重构Meta模型的新技术。 DeepSeek-R1之所以能在编程和推理任务上展现如此强劲的实力,离不开它的底层 架构优化。尽管它的创造力和语言组织能力可能仍然比不上o1 Pro,但要注意,它 的参数量远远小于后者。DeepSeek-R1的总参数规模只有6710亿个,而且是基于混 合专家模型(Mixture of Experts,MoE)架构,这意味着它在一次推理调用时, 实际激活的参数只有370亿个。 相比之下,GPT-4级别的大模型通常需要调用数千亿个参数,计算资源消耗巨大, 而DeepSeek-R1能够在较小的参数规模下,仍然提供高质量的推理和编程能力,这 表明其技术优化能力已经达到了惊人的水平。 更重要的是,DeepSeek-R1这种“小模型大能量”的设计思路,使其在计算资源的 消耗上具有明显的优势。AI模型的性能,往往需要在计算效率和智能水平之间找到 最佳平衡点,而DeepSeek-R1的架构显然在这方面做到了极致优化。它不仅让模型 在较小的算力消耗下展现接近甚至超越国际旗舰大模型的表现,同时也让整个模型 更加灵活,适用于更多的实际应用场景。 相比那些需要大量计算资源才能运行的超大模型,DeepSeek-R1的优势更加明显, 这意味着它可以在更多的设备、平台和业务场景中高效运行,而不必依赖昂贵的高 性能计算资源。 DeepSeek的这一设计思路,不仅让其模型在性能上取得了突破,更重要的是,使它 成功地找到了降低AI模型成本、提高AI可用性的方式。对于企业用户来说,AI模型 的落地不仅要考虑性能,还要考虑运行成本、推理速度、商业化适配性等因素。而 DeepSeek-R1的架构,使得它在这些方面都具有很强的竞争力,让它不仅是一个强 大的技术产品,更是一款具备商业落地价值的AI模型。 1.2.2 便宜到惊人,革命性的性价比 DeepSeek实在太便宜了。根据公开数据,o1的训练成本高达上亿美元,而DeepSeek 的训练成本却不到600万美元。这个对比简直是碾压级的——相当于OpenAI花20块 钱才能干成的事,DeepSeek只用1块钱就搞定了,而且效果还不差。 这种极致的成本优化能力,不仅意味着DeepSeek可以持续以极低的价格提供高质量 的AI服务,还意味着它可以在商业竞争中进一步拉低整个行业的产品定价,让更多 企业和开发者都能用得起AI,而不仅仅是大型科技公司。同时也让千行百业看到了 另一种可能性,那就是在各自的垂直领域,完全可以构建起轻量化高性能模型。
Page 11
10 要知道,一直以来,AI行业都被高昂的算力成本所困扰,特别是在大模型的训练和 推理阶段,GPU资源的消耗极为惊人。OpenAI、Anthropic、DeepMind等头部AI企 业,都不得不依赖英伟达提供的高端AI芯片,每训练一个新模型,成本都以亿美元 计。这让很多行业,让很多希望借助AI实现效率优化的企业望而却步,如医疗、教 育、工业等行业企业。 但DeepSeek的出现改变了AI模型之前的训练逻辑,其模型不仅轻量,还能以极低的 算力满足高性能的运行需求。而DeepSeek之所以能做到成本的大幅削减,核心在于 它对模型架构和算力调度的极致优化。它采用的混合专家模型架构,可以让模型在 每次推理时只激活部分参数,而不是整个模型一起计算,大幅减少了算力消耗。 同时,DeepSeek在数据处理、并行训练、推理计算等多个环节,都进行了深度优 化,使得它在相同的算力条件下,可以训练出更好的模型。换句话说,它不仅会省 钱,而且还能保证模型的质量不打折扣。 DeepSeek的API价格比GPT-4o的要低好几倍,这就导致国内的AI供应商被迫跟进降 价,字节、阿里、百度、腾讯纷纷调整价格策略,并且这种降价压力已经开始向海 外市场蔓延,影响到了OpenAI和Anthropic等国际AI公司。AI本来是一个高投入、 高回报的领域,但DeepSeek的定价策略正在重新定义游戏规则,让AI模型从昂贵的 高端科技变成了一种人人都用得起的生产力工具。 这一现象的直接成效,就是DeepSeek应用的用户数量开始呈指数级增长,并迅速抢 占全球市场。DeepSeek在苹果应用商店的成绩,表明这不是一个简单的市场波动, 而是在释放一个清晰的信号:DeepSeek已经不再只是中国的AI新星,更是一个正在 全球范围内挑战OpenAI霸主地位的强劲竞争者。 DeepSeek的成功也对资本市场产生了直接影响。过去几年,AI芯片需求的爆发是英 伟达股价暴涨的重要支撑点,但DeepSeek的出现让人们开始重新思考:如果AI模型 可以更高效地训练,是否意味着未来对昂贵GPU的需求会降低?这种思考及市场情 绪的变化,进一步证明DeepSeek的影响力已经超越了行业本身,开始撼动整个科技 生态,改变了以往AI模型的叙述方式。 AI行业的竞争,已经不再只是“谁的模型更聪明”这么简单,而是演变成了一场关 于技术、成本、商业模式和市场布局的全方位竞赛。而DeepSeek正在用前所未有的 低成本、高性能AI技术,改写这场竞赛的规则。如果它能继续保持这种极致的性价 比优势,那么未来,它不仅会成为中国AI领域的领军者,甚至可能成为全球AI行业 最重要的破局者。 1.2.3 彻底开源,真正的“AI界安卓”
Page 12
11 之前,AI行业的主流做法是封闭生态,例如OpenAI的ChatGPT、Anthropic的Claude 和DeepMind的Gemini,基本都采取了“闭源+高价”的模式。想用?可以,但要么 交高额的API费用,要么只能依赖官方的封闭产品,开发者无法自由调整,企业也 无法掌握数据安全。 但DeepSeek直接来了个反向操作——全开源,不仅可免费下载,还公开了训练方 法,甚至允许其他开发者用它的技术去训练自己的模型,并且还能商业化。这就意 味着,全球任何人都可以基于DeepSeek-R1开发自己的AI,而无须受制于任何商业 公司的政策和定价。 DeepSeek不仅开源了自己的大模型,甚至还主动对市面上的两个开源模型(Qwen和 Llama)进行蒸馏,训练出了六个高性能的“小模型”,并且无条件开放给所有开 发者。这些小模型的表现同样惊人(见图2)——例如,一个仅有320亿个参数的模 型,在数学任务上的表现居然超过了o1-mini;更夸张的是,一个只有15亿个参数 的“迷你模型”,在数学和算法竞赛任务上的表现竟然超过了GPT-4o和Claude- 3.5-Sonnet这两个最主流的闭源模型。 图2 DeepSeek各蒸馏模型与主流模型在不同基准测试中的表现对比 这种突破,让DeepSeek不仅在大规模AI应用上占据了领先优势,还成功打破了人们 对“AI只能依赖云端算力”的传统认知。因为15亿个参数的模型,已经轻量到可以 直接在个人计算机甚至手机上运行。换句话说,DeepSeek的开源策略,不仅仅是开 放了一个大模型,而是彻底让AI从“云端霸权”变成了人人都可以使用的智能工 具。
Page 13
12 反观ChatGPT,它虽然仍然是当前AI领域的佼佼者,但封闭性却成了它最大的短 板。如今,ChatGPT正在逐渐变成“AI界的苹果”——性能强大,但极度封闭。其 API价格居高不下,企业想要部署自己的私有AI助手,不仅得支付昂贵的费用,还 得完全依赖OpenAI的云端,没有自主权,甚至连数据隐私都无法完全掌控。 换句话说,使用ChatGPT意味着我们的数据要交到OpenAI手上,而企业最关心的恰 恰就是数据安全。如果未来某一天,OpenAI调整价格、修改政策,或者限制API权 限,企业只能被迫接受,而无法做出任何改变。而DeepSeek的开源模式,直接打破 了这种垄断,它更像是“AI界的安卓”——谁都能用,谁都能改,不仅给开发者提 供了极大的自由度,也让企业能够更安心地将AI部署到自己的服务器上,确保数据 的安全性和可控性。 更重要的是,DeepSeek的开源策略,还让全球的开发者都能参与进来,共同优化模 型,让它越用越强。相比之下,封闭的AI公司只能依靠自己的团队做优化,进展速 度必然受限;而DeepSeek的开源模式类似于Linux和安卓,全球的开发者都可以贡 献自己的改进方案,不断优化代码、修正漏洞,增强模型的推理能力。 这种模式的优势在技术发展史上已经被无数次验证——Linux打破了微软Windows的 市场垄断,Android让智能手机不再受限于苹果的封闭生态……如今,DeepSeek正 在用同样的逻辑,挑战AI行业的现有秩序。 DeepSeek的开源策略不仅让它在开发者社区中迅速积累了大量支持者,也让AI行业 的竞争规则发生了彻底变化。过去,大模型的竞争主要是参数规模的较量、算力投 入的比拼,而DeepSeek的开源模式,则让竞争从“谁的模型更大”变成了“谁能让 AI真正普及”。 这场变革的影响力远比我们想象的更为深远——如果未来越来越多的开发者基于 DeepSeek-R1进行二次开发,全球范围内会诞生出大量的行业专用AI模型,它们的 功能可能更加精准,应用范围更加广泛,而OpenAI、Anthropic、DeepMind这些选 择闭源的公司,则可能会逐渐丧失市场主导权。因为,历史已经一次又一次地证 明,技术的进步,往往源自开放与合作。正如尽管苹果的iOS封闭系统占据着一定 的市场份额,但是安卓这种开源系统的市场占有率远超前者。 如果说过去几年,OpenAI一直是AI行业无可争议的领头羊,那么DeepSeek的崛起, 可能会使整个行业的未来走向发生巨变。 DeepSeek的成功让我们不得不重新思考:未来的AI行业,还会继续走封闭生态的老 路吗?OpenAI、Anthropic等头部企业,是否会被迫调整自己的策略?国产AI是否 能够借助这次机会,在全球市场上站稳脚跟?DeepSeek会不会将业务扩展到AI搜
Page 14
13 索,甚至AI硬件领域?这些问题,已经突破行业界限,开始影响全球科技产业的未 来。 一切都充满了未知,但可以肯定的是,DeepSeek已经改写了AI行业的游戏规则。 OpenAI或许仍然强大,但它已经无法再像过去一样,高高在上地掌控AI市场,因为 DeepSeek的崛起,已经让AI的未来变得更加开放、更加民主、更加充满可能性。 1.3 DeepSeek的崛起之路 随着DeepSeek应用的爆火出圈,它的故事也开始进入公众视野,受到了广泛关注 ——没有人不好奇,这么一款极具性价比的AI产品,到底是怎么诞生的?DeepSeek 诞生的背后,又是一个什么样的故事? 1.3.1 从量化交易到AI先锋 要了解DeepSeek的故事,就不得不提到DeepSeek的创始人——梁文锋。梁文锋是一 个典型的小镇少年。1985年,梁文锋出生在广东湛江的一个普通家庭。他的父亲是 一名小学教师,从小就对他的学习给予了很大的支持和引导。 在这样的家庭环境下,梁文锋对数学和计算机产生了浓厚的兴趣。初中时,他就提 前学完了高中的数学课程,甚至开始自学大学数学。 2002年,17岁的梁文锋以优异的成绩考入浙江大学电子信息工程专业。在大学期 间,他不仅在本专业表现出色,还积极参与各种数学建模竞赛,展现了非凡的才 华。本科毕业后,他继续在浙江大学攻读信息与通信工程硕士学位,专注机器视觉 的研究。 梁文锋的研究生阶段,正值2008年全球金融危机爆发,金融市场动荡不安。他敏锐 地意识到,数学和计算机技术或许可以用来应对金融市场的波动。 于是,梁文锋开始带领一群志同道合的同学,尝试用机器学习的方法分析市场数 据,探索自己的量化交易方法。他们收集了大量的市场行情、宏观经济数据,利用 数学建模的方法研究价格波动的规律。这些早期的探索为梁文锋日后的创业奠定了 坚实的基础。 梁文锋所聚焦的量化交易,简单来说,就是用计算机程序代替人工进行交易。一旦 市场交易情况满足某些条件,程序就会自动执行操作,进行买入、卖出等。
Page 15
14 早些年,交易员们都是自己盯着市场行情,根据经验和直觉来决定什么时候买进或 卖出的。但人的精力有限,面对海量的市场信息,很难全面、及时地做出反应。随 着计算机技术的发展,金融专家们开始探索利用计算机强大的计算能力,分析市场 数据,制定交易策略。于是,量化交易应运而生。 量化交易的核心是利用数学模型和算法来自动化交易决策。首先,需要收集大量的 市场数据,如股票价格、交易量、公司财报等。然后,利用统计学和机器学习的方 法,对这些数据进行分析,寻找市场中的规律。接着,根据发现的规律,建立数学 模型,制定交易策略。最后,将这些策略编写成计算机程序,实时监测市场,一旦 满足设定的条件,程序就会自动执行交易。 2013年,梁文锋与大学同学徐进共同创立了杭州雅克比投资管理有限公司,正式进 军量化投资领域,公司名称就取自德国数学家卡尔·雅可比。 两年后,他们又成立了幻方量化(High-Flyer),专注利用数学和人工智能进行量 化投资。在2015年的市场波动中,幻方量化凭借先进的高频量化策略取得了令人瞩 目的成绩。2016年,幻方量化推出了首个基于深度学习的交易模型,实现了所有量 化策略的AI化转型。到2019年,幻方量化的资金管理规模突破一百亿元,成为中国 最大的量化基金管理公司之一。 1.3.2 幻方量化的转折点 2016年对幻方量化来说,是一个重要的转折点。这一年,他们推出了首个基于深度 学习的交易模型,开始用AI来指导投资决策。以往,量化交易依靠的是统计模型、 数学公式和传统编程逻辑,而深度学习的加入,让交易系统有了更强的自适应能 力,能够更快地捕捉市场趋势、识别投资机会,并实时调整策略。AI的引入,让幻 方量化的交易决策更智能、更高效,也让他们在竞争激烈的量化交易市场中,迅速 拉开了与同行的距离。 到了2018年,幻方量化做出了一个重要的战略决策——正式将AI作为公司的核心发 展方向。这意味着其不仅在交易策略上更依赖AI,而且将全面向AI驱动的交易体系 转型。他们不再只把AI当成一种工具,还要让AI成为量化交易的灵魂。这个决定, 标志着幻方量化不仅是一家量化交易公司,还是一家技术驱动的AI企业。 但随着交易策略的复杂化和业务规模的急剧扩张,幻方量化很快遇到了一个前所未 有的问题——计算资源瓶颈。 就像家里的一台老电脑在跑大型3D游戏时会卡顿一样,幻方量化原有的计算平台已 经满足不了模型的需求了。AI模型的深度学习训练需要巨大的算力支撑,而原先的
Page 16
15 计算资源,已经无法满足他们对交易模型的训练和优化需求。这不仅影响了交易决 策的效率,也限制了他们进一步开发更高级AI算法的可能性。 面对这个问题,幻方量化决定不再依赖外部的算力供应,而是搭建一套属于自己的 AI训练平台。2019年,在梁文锋的带领下,幻方量化自主研发了“萤火一号”训练 平台。这是一个堪称豪华的计算集群,总投资接近2亿元,搭载了1100块GPU。GPU 就像是AI计算的发动机,数量越多,计算能力就越强。对于AI模型训练来说,更多 的GPU意味着可以更快地完成模型训练、更高效地优化算法,让交易系统具备更强 的学习能力。 “萤火一号”的投入,让幻方量化的AI模型训练速度大幅提升,也使他们的交易策 略更加精细化、实时化,交易效率提升到了一个全新的水平。 但幻方量化的野心显然不止于此。量化交易只是他们实现AI梦想的第一步,而真正 的挑战,是如何让AI走得更远。随着AI模型规模的不断扩大,计算需求再一次暴 增,“萤火一号”已经不够用了。他们意识到,要在AI领域真正取得突破,必须进 一步提升计算能力。于是,在2021年,幻方量化做出了更大手笔的投入,正式推出 “萤火二号”。 相比“萤火一号”,“萤火二号”堪称计算怪兽——这次幻方量化直接投资10亿 元,配置了约1万张英伟达A100 GPU,让训练平台的计算能力再一次实现了指数级 跃升。这套平台不仅能支持更大规模的AI模型训练,还能让AI交易系统的运行效率 达到前所未有的水平。 更重要的是,“萤火二号”不仅仅是为量化交易服务的,它还为幻方量化进军更广 阔的AI领域铺平了道路。当AI交易技术日渐成熟,幻方量化开始思考:如果AI能优 化金融市场的交易策略,那么它是否也能用在更广阔的商业场景?AI本身是否就是 一个值得深耕的产业?这一思考,最终促成了一个重要的决策——幻方量化要打造 自己的AI模型,并进军人工智能产业。这也成了DeepSeek诞生的前奏。 1.3.3 DeepSeek的诞生与突破 DeepSeek的诞生,离不开幻方量化在AI应用领域的持续探索。作为国内顶级的量化 私募之一,幻方量化一直在寻找让自己算法更强的方法,而AI正是他们实现突破的 关键。 从“萤火一号”到“萤火二号”,幻方量化在AI上的投入越来越大,开始自己采购 高性能芯片来搭建训练集群。当时在国内,只有阿里等极少数科技巨头才拥有这样
Page 17
16 的资源,而幻方量化作为一家金融机构也铺设了自己的AI之路。这条路,不仅让幻 方量化在金融圈遥遥领先,也为如今DeepSeek的诞生埋下了伏笔。 终于,在2023年,DeepSeek正式从幻方量化独立出来,成为一家独立运营的AI公 司。它的目标不是要造出一个更强的金融AI,而是要直接开发出真正具备人类智能 水平的AI模型。换句话说,DeepSeek不是要做个更聪明的交易算法,而是要在AI领 域正面挑战OpenAI、DeepMind、Anthropic等全球AI巨头。 但要实现这个目标,谈何容易。 DeepSeek的第一个难题,就是资金和资源的筹措。虽然幻方量化给了DeepSeek不小 的资金支持,但众所周知,AI模型就是个烧钱的无底洞。训练一个顶级模型需要庞 大的算力支撑,而算力意味着大量昂贵的芯片和服务器。 在有限的资源下,DeepSeek要开发出一个能与国际巨头竞争的AI模型,难度可想而 知。服务器的风扇声嗡嗡作响,电脑屏幕上密密麻麻的代码和损失曲线成了他们生 活的全部。DeepSeek的工程师们知道,不能靠堆资源,只能靠更聪明的算法。 第二个难题,就是技术的突破。AI领域的主导权已被大厂和顶尖科研机构牢牢掌 握,OpenAI、DeepMind、Meta、Anthropic等头部AI企业每年投入数十亿美元,而 DeepSeek想要杀入这一领域,简直是以小博大的极限挑战。 第三个难题,就是人才的投入。无论是苹果、DeepMind、Meta,还是OpenAI,都有 庞大的人工智能研究团队。例如OpenAI就有1700人的研发团队,而人工智能领域的 人才又是各大科技公司高价挖角的对象。如果不能以创新的方式应对,大量的人才 投入就会给DeepSeek带来巨大的挑战与压力。但梁文锋带着的团队,仅仅是约150 人的小团队,他们深知,如果不能在算法上找到突破点,不能让团队的成员发挥强 大的创新力,DeepSeek就永远无法超越那些资源丰富的大公司。 于是,他们提出了全新的MLA(多头潜在注意力机制)架构,大幅降低了模型的显 存占用。这意味着,在相同的算力下,DeepSeek的模型可以处理更复杂的任务,训 练成本也大幅降低。这种创新,使得DeepSeek即便资源有限,也依然能开发出高性 能的AI模型。 2024年5月,DeepSeek发布了DeepSeek-V2,这款模型一发布就震动了整个行业。它 的推理成本显著低于当时的主流模型(是Llama3-70B的1/7、GPT-4 Turbo的 1/70),而性能却几乎不输阵。更炸裂的是,DeepSeek-V2不仅性能强,还直接开 源,这一招彻底引爆了国内大模型的价格战。
Page 18
17 但DeepSeek的目标,远不止于此。2024年12月,DeepSeek-V3问世,这一版的模型 性能已经逼近GPT-4,但训练成本却只有后者的1/20。这种极致的成本优化能力, 直接让所有AI研究者都瞠目结舌。 DeepSeek-V3的成功,标志着DeepSeek的技术已经达到了国际一流水准,中国的AI 公司中终于有了可以真正比肩OpenAI的竞争者。 2025年一开年,DeepSeek再一次发布了新的R1模型,这次,它不仅在国内爆火,还 在海外引起了广泛关注。R1模型的性能和OpenAI的o1模型相当,但在推理速度和成 本控制上更胜一筹。这意味着,DeepSeek不仅在训练成本上打败了OpenAI,就连实 际应用上的效率也更高。 可以说,从金融领域起步,深耕量化交易,到成立DeepSeek,梁文锋带领团队走出 了一条属于自己的AI之路。如今,DeepSeek已经成为全球AI领域不可忽视的力量, 不仅改写了AI行业的游戏规则,也向世界展示了中国AI的实力。 1.4 为什么DeepSeek的成功是必然的 今天,DeepSeek已经成为AI领域一颗冉冉升起的明星,它的成长速度快得惊人。那 么,DeepSeek的成功,到底是运气,还是必然? 其实,如果我们回顾DeepSeek的发展路径,就会发现,它的崛起绝不是偶然,而是 一种技术积累、战略选择和市场趋势共同推动的结果。DeepSeek的成功,并不是 “撞大运”,而是它从一开始就选对了路,走对了每一步。 1.4.1 AI金融化的初衷与实践 DeepSeek的崛起其实是一次顺理成章的进化,与那些从科研机构成长起来的AI公司 不同,DeepSeek的起点并不是在实验室里扩展科技前沿的学术研究,而是一个实际 的商业应用场景——量化交易。相比那些怀揣理想,希望打造“通用人工智能” (AGI)的公司,孵化DeepSeek的幻方量化的目标从一开始就非常明确——做AI不 是为了做研究,不是为了写小说,不是为了跑参数,而是为了应用,为了借助AI技 术的落地应用赚钱。 量化交易作为一种依靠数学模型、统计分析和高性能计算来执行金融交易的方式, 它的核心在于数据、算法和算力。每天,金融市场上都会产生海量的交易数据,而 量化交易的任务,就是从这些数据中挖掘出可以盈利的模式,并通过自动化交易系
Page 19
18 统迅速执行,最大化收益。这一过程不仅依赖对市场的深刻理解,更依赖对计算资 源的极致优化。 而梁文锋带领的团队就在这一过程中积累了丰富的经验,他们擅长构建高效的算 法,优化计算性能,管理数据流动,而这些经验,恰好与AI模型的训练有着高度的 契合。 相比那些从学术研究起步的AI公司,DeepSeek的成长路径显得更加务实。许多AI公 司都是先开发出一项技术,再去寻找市场应用,而DeepSeek的方式则完全相反—— 他们从最具商业价值的场景出发,直接在量化交易领域落地实践,并在过程中不断 优化和改进自己的技术。 毕竟,AI金融化是一个实实在在的应用需求,DeepSeek的早期AI探索正是基于这一 需求展开的。他们并不满足于在实验室里验证算法的可行性,而是直接将其应用到 市场交易中,让AI模型接受严苛的实战检验。 这种路径的最大优势在于,它避免了闭门造车的问题。在学术研究领域,许多AI技 术的开发都是从理论出发的,而现实世界的复杂性往往远超实验室环境。DeepSeek 从一开始就跳过了“研究—验证—应用”的漫长过程,而是直接在市场环境中测试 和优化AI技术,形成了一条“应用—优化—创新”的闭环路径。这不仅让他们的技 术能够快速适应真实需求,还让他们在早期就建立了一整套完整的AI应用逻辑。 事实上,正是在量化交易的过程中,DeepSeek的团队逐渐意识到,AI的能力远不止 于此。AI不仅可以辅助交易策略的制定,还可以优化数据分析,提升计算效率,甚 至自动化整个交易流程。 换句话说,AI不仅仅是一个辅助工具,它本身就是决策的一部分。而这种认知,也 让DeepSeek迈出了向研发AI模型转型的关键一步。 从技术角度来看,量化交易与AI的核心机制有许多相似之处。二者都是高度依赖数 据的计算任务,量化交易靠市场数据,AI推理靠训练数据;二者都需要强大的算力 支持,量化交易需要实时处理市场信息,而AI模型训练需要大量GPU资源进行复杂 计算;二者都对算法优化极度敏感,一个小小的参数调整可能决定量化交易的成 败,也可能显著影响AI模型的性能。 这种相似性,使得DeepSeek的技术团队在进入AI领域时,具备了得天独厚的优势 ——他们已经在苛刻的计算环境中锻炼出了一套独特的算法优化能力,而这正是AI 模型研发过程中最宝贵的资产。
Page 20
19 因此,DeepSeek投身AI领域,并不是一次从零开始的冒险,而更像是一次自然的技 术演进。他们在量化交易中积累的计算能力、数据管理经验和算法优化技术,几乎 可以无缝迁移到AI模型的训练之中。 更重要的是,DeepSeek并没有停留在技术研发的阶段,而是继续保持了他们务实的 商业思维。对于DeepSeek而言,AI不是一个高深的研究课题,而是一项需要落地的 技术。他们并不满足于做一个“技术提供方”,而是希望让AI真正进入商业应用场 景,创造价值。 这种思维方式,让DeepSeek在AI领域迅速崛起,其团队对数据管理、算力优化、算 法架构等多个方面进行了深度优化,使其AI模型在性能和商业化能力上都具备了极 强的竞争力。 DeepSeek的崛起并不是“天降神兵”,也不是由资本堆出来的泡沫,而是多年技术 积累和行业理解的自然延伸。DeepSeek的成功,不仅仅是因为他们有足够的算力和 强大的算法,更重要的是,他们深刻理解AI的应用逻辑,知道如何把AI技术变成真 正有价值的产品。这种路径不仅让DeepSeek的技术更加贴近实际需求,也让其比那 些纯科研型的AI公司更具商业优势。 DeepSeek的故事,也让我们看到:技术的成功,不仅仅依赖创新,更依赖应用场景 的选择。AI的价值,最终要体现在实际应用之中,而不是停留在论文里,也不是停 留在套壳里,更不是停留在PPT的领先里。可以说,DeepSeek的成功,不是偶然, 而是技术积累、市场洞察和战略执行的必然结果。未来,DeepSeek能否挑战OpenAI 这样的全球AI巨头,仍然是一个未知数。但有一点是确定的——它已经走出了一条 与众不同的发展路径,而这条路径,可能会成为未来AI产业的一种新范式。 1.4.2 算力布局的领先者 在人工智能的世界里,有一句话广为流传:算力为王。这不是夸大其词,而是赤裸 裸的现实。拥有多少算力,直接决定了能训练多大的模型,能处理多少数据,能完 成多复杂的任务。而DeepSeek,正是国内最早一批深刻理解这一点,并且敢于在算 力上重金投入的公司之一。 很多AI公司在起步时,往往先专注算法研究,然后才开始考虑计算资源的问题。但 DeepSeek的思维方式不同,他们从一开始就明白,如果没有足够的算力支撑,再好 的算法也只能停留在理论层面,无法真正落地。为了确保自己在AI竞赛中不落后, DeepSeek做了一个极其重要的决定——大规模部署英伟达A100 GPU。这在当时的国 内AI圈里,是一件相当超前的事情。
The above is a preview of the first 20 pages. Register to read the complete e-book.

Recommended for You

Loading recommended books...
Failed to load, please try again later

Tip the Site

Scan the WeChat Pay or Alipay code to tip. No login required.

WeChat Pay
Alipay
Back to List