2025-02-19
公司成立,由幻方量化孵化,专注通用人工智能(AGI)。
开源 7B/67B 基础模型,代码与数学能力超越 Llama2。
发布 V2 模型,推理成本降至行业 1%,引发国内大模型行业的接口价格战。
推出 V3 模型,性能比肩 GPT-4,训练成本仅为 557 万美元。
开源推理模型 DeepSeek-R1,引爆全网,DeepSeek App 在苹果应用商店中国、美国、英国等 157 个国家登顶下载榜。1月30日,DeepSeek 的 DAU 达到 2215 万,成为全球增长最快的 APP,相当于同期 ChatGPT DAU(5323万)的 41.6%。
数据源 埃隆·马斯克 Grok 3 发布会 时间:2025-02-18
Benchmarks:关注于量化评估和标准化测试

Chatbot Arena: 强调实时互动和用户体验

推理模型测评:美国数学竞赛 2025(中学)

埃隆·马斯克仅用122天完成自建集群,包含10万块NVIDIA H100 GPU。之后扩展到20万块GPU,包括新增的H100和H200。
294亿-437亿美元(约人民币 2116亿-3144亿元)仅GPU采购需准备 250亿-350亿美元,实际部署需追加 40%-60% 配套投入。

Deepseek 训练成本:旗舰模型DeepSeek-V3的训练成本为560万美元。这一数据由公司直接披露,且远低于美国同类模型的投入规模(如OpenAI的模型通常需数十亿美元)
根据相关信息推测,DeepSeek的母公司拥有约50,000张英伟达GPU,主要包括H800、H100以及H20等型号。这些显卡分布在量化交易、AI训练、推理及研究等多个领域,并与母公司幻方量化共享资源。需要注意的是,由于美国出口管制政策,H20是目前中国AI公司可合法采购的英伟达高端GPU型号。
购买GPU费用约7亿美元(约合人民币49亿元),服务器总资本支出约26亿美元(含硬件、运营等)
注:H100 在20年左右已经被美国出口管制,幻方量化的官方信息中提及其于2018年左右开始囤积显卡资源。
、




(中译本约50万字/本)
(总15万字 ≈ 10万token,成本1.6元)
deepseek 变成了 “openAi”
openAi 变成了 "closeAi"
LLM相当于操作系统的内核,负责协调存储、工具调用和任务调度。例如ChatGPT的Transformer架构类似于iOS内核,而DeepSeek的开源特性更接近Android的模块化设计
LLM调用代码解释器、搜索API等功能,相当于操作系统调用浏览器、计算器等应用
类似iOS/macOS,由单一厂商主导优化和功能迭代
类似Android/Linux,依赖社区协作和多样化适配

附 57个公开的接入 Deepseek-r1 模型的企业&产品
主流GPU方案
华为NPU方案
其他成本
数学推理接近 GPT-4,代码生成超越 CodeLlama。支持 128k 长文本处理。
训练成本仅为 GPT-4 的 1/10,API 价格低至每百万 tokens 1 元。硬件需求低,支持边缘部署。
模型权重、训练方法全公开,支持商业用途。吸引开发者共建生态,降低教育机构接入门槛。
参数就像模型的“脑细胞数量”。
每个参数是模型用来记住语言规律的开关(比如“苹果是红色的”和“香蕉是黄色的”这种关联)。参数越多,模型能记住的细节越多,回答问题的能力越强。模型对应的就是神经网络中的层数,比如1.5B参数的模型(如DeepSeek-R1-Distill-Qwen-1.5B)通常采用32层Transformer结构,每层参数量约为4700万。
DeepSeek-V3V3 是通用型大语言模型,擅长自然语言处理。
上下文长度 64K,输出长度 8K
✅训练方法:
传统预训练+监督微调,采混合专家架构(MoE)(总参数6710亿,单Token激活370亿)
✅ 应用场景:
智能客服、文案创作、多模态内容生成
DeepSeek-R1R1 专精复杂推理,包括数学、代码生成和逻辑链分析。
上下文长度 64K,思维力长度 32K,输出长度 8K
✅ 训练方法:
跳过监督微调,通过两阶段强化学习(GRPO算法)从基础模型直接训练,降低计算成本
✅ 应用场景:
科研计算、金融量化分析、代码生成
R1专注于复杂推理与创造力,其训练强化了思维链(CoT)和深度思考能力。这就像让诗人做数学题——创造力越强,越容易“脑补”不存在的信息。
R1跳过了监督微调阶段,直接通过**强化学习(GRPO算法)**激发推理能力。这种训练方式鼓励模型“自由发挥”,但缺乏对事实准确性的约束。就像学生跳过基础练习直接解难题,容易忽略基本事实。
大模型本质是概率接话者,当遇到训练数据中低频或缺失的信息(如“xxx的身高”),R1会基于泛化知识编造看似合理的内容。而R1的强化推理能力放大了这种“脑补”倾向,例如在文献查询中虚构作者和出版社。
R1擅长数学代码等结构化任务,但被误用于需要严格事实核查的场景(如历史考据)。就像让物理学家写小说,专业错配导致错误率飙升。
RAG ≠ 微调,RAG 的内容会附加到模型的上下文中,受上下文限制
RAG是检索增强生成的缩写,全称是Retrieval-Augmented Generation
RAG是一种结合外部知识库的技术框架。它旨在提升大模型的回答质量,让模型能够“开卷考试”。

我司内部未部署私有化Deepseek模型,调用的是火山引擎(字节)提供的开发者接口。
是金山办公旗下面向B端用户的智能对话式人工智能助手。通过AI问问,企业可以快速接入智谱清言、 Minimax、文心一言、GPT、Claude等主流大模型,一站式体验多个模型的智能服务。
能够结合企业私域知识和网络信息提供答案,通过对话形式更轻松地获得文档信息,推动企业文档沉淀和知识再利用。
将自动生成结构化纪要、AI提炼会议精华、对话式问答定位关键信息,并配备时间戳精准回溯功能,实现会议内容高效沉淀与知识复用。







验证了免费下载+内购模式,激励应用内购生态发展。
推动iOS应用进入家庭教育与娱乐场景,加速渗透。
趣味性的“伪对话”机制,培养用户对语音交互的接受度。
在大模型时代,能够有能教育用户的「AI 原生应用」。
利旧:结合校本资源库、公开教材与Aidocs数据,发挥金山文档存储、文档解析的优势,构建数据基础,提升模型准确性。
默认采用当前最强模型,demo阶段易于部署。未来可接入公司AI Hub,顺应技术发展趋势。
通过AI提效,这是demo阶段核心需要设计的。大的原则要激发WPS 365产品,作为办公的平面。基于 WPS 365相关能力,做好用户与AI的协同交互体验,通过agent智能体,进行一些自动化流程的实现。
具体什么表现形式,还需要进一步讨论。永远不要奢求ai的输出一次性的满足用户所有场景
初期选定智能备课,后续拓展项目化教学等场景。需求来源需自上而下,由学校或协会等单位发起(如PBL 项目化教学等场景)

保障数据安全与隐私,是各行业应用的基础。
大语言模型提供强大的语义理解和生成能力。
基于WPS 工具的实现高效、智能的应用流程。
如果教育的教案场景验证通过
✅ 金融场景 → 研报
✅ 医疗场景 → 电子病历
✅ 党政场景 → 电子公文
完成基础数据库的建设。
目标是提升AI对教育文档的理解能力
Demo在单一场景下可运行。目前选定的场景是智能备课
整理对客的方案,划定试点。并持续跟踪用户反馈,持续改进,验证通过后吗,逐步进行产品化。
DeepSeek 教育行业培训