添加微信号:CVer2233,小助手拉你进群!
扫描下方二维码,加入CVer学术星球!可以获得最新顶会/顶刊上的论文idea和CV从入门到精通资料及应用!发论文/搞科研/涨薪,强烈推荐!
添加微信号:CVer2233,小助手拉你进群!
扫描下方二维码,加入CVer学术星球!可以获得最新顶会/顶刊上的论文idea和CV从入门到精通资料及应用!发论文/搞科研/涨薪,强烈推荐!
转载自:CVer微信公众号
Amusi 昨天刷微博,看一条热搜消息,直接“笑晕”了~ “印度、韩国突然宣称造出媲美 DeepSeek 的大模型”,全球 AI 进入“ DeepSeek 时刻”?
原来是 —— India Plus 在 X 平台上发布所谓🚨重磅消息:🇮🇳印度Sarvam AI联合创始人Vivek Raghavan称,该公司仅花费2000万美元就构建了3个AI模型,比中国DeepSeek的成本更低。
近期,印度和韩国确实有多家企业和机构高调宣布推出了“媲美甚至超越 DeepSeek”的本土大模型,但经过调研,发现这些模型普遍存在“套壳”、蒸馏微调或仅在特定场景占优的现象,其宣传口径与实际技术实力之间存在明显落差。
🇮🇳 印度:主打低价与“套壳”微调
印度方面主要有 Sarvam AI 和 169PI 等企业参与,但核心技术多依赖中国开源底座。
- 169PI 的 Alpie 模型:该模型仅有 320 亿参数,但在部分数学和软件工程榜单上表现亮眼。然而,技术开发者拆解后发现,Alpie 并非完全从零自研,而是基于中国开源模型 DeepSeek-R1-Distill-Qwen-32B 进行了二次蒸馏、量化和微调。这本质上是“套壳”操作,在脱离特定场景后,其逻辑推理和长文本理解等通用能力与 DeepSeek 存在明显差距。
- Sarvam AI:该公司宣称仅用 2000 万美元就训练出三款模型,成本远低于 DeepSeek。但开源其 Sarvam-105B 模型后,行家发现其底层架构借鉴了 DeepSeek 的设计(如 Multi-head Latent Attention 和 MoE 架构),被指为“山寨缩水版”,与其对外宣传的“完全自主”存在出入。
🇰🇷 韩国:偏科严重与代码雷同
韩国的模型虽然在参数规模上更大,且有一定的自主研发成分,但同样面临诸多争议。
- Motif-3 Beta:由一个约 30 人的团队在 5 个月内开发,总参数达 3140 亿(MoE 架构,激活约 130 亿)。该模型专门使用约 106GB 的韩语语料进行预训练,主打韩语自然语言处理(NLP)。虽然在韩语专项测试中表现不错,但在全球通用基准测试中表现平平,被网友戏称为“韩专精特供版”。
- LG 的 K-EXAONE 2.0:这是韩国目前规模最大的基础模型,总参数高达 7500 亿。但在全球通用基准测试中,其平均分与 DeepSeek 同代模型仍有显著差距。此外,在韩国的国家级 AI 竞赛中,多支顶尖队伍的核心代码被发现与 DeepSeek、千问等中国开源模型高度雷同,甚至连版权标记都未删除干净。
📊 核心差距对比一览
表格
| 维度 | 印度/韩国模型 | DeepSeek (V4 Pro) |
|---|---|---|
| 参数规模 | 最大 7500 亿 (K-EXAONE) | 2.8 万亿,差距一个量级 |
| 架构原创性 | 多为蒸馏微调或架构借鉴 | 完整自研 MoE 架构 |
| 基准表现 | 仅在特定语言或数学榜单占优 | 通用任务、代码、长文本等综合能力强 |
🤔 为什么都选择对标 DeepSeek?
印韩两国不约而同地将 DeepSeek 作为对标对象,背后主要有三个原因:
- 开源降低了门槛:DeepSeek 等中国模型的开源,大幅降低了研发通用大模型的成本和技术门槛。与其投入巨资从零开始,不如利用现成的开源底座进行本土化适配,既省钱又高效。
- 政府补贴推动:两国政府都希望通过“主权 AI”战略掌握主动权。韩国政府为 Motif 团队提供了 700 多块英伟达 B200 GPU;印度政府则为 Sarvam AI 提供了 4096 块 H100 的使用权。这些算力补贴是他们快速入场的直接推力。
- AI 主权叙事:两国都希望建立本土的 AI 生态,避免在核心技术上完全依赖外国公司。打出“超越 DeepSeek”的口号,既能迎合国内“技术自主”的叙事,也能在国际上吸引关注和投资。
总的来说,这场风波反向证明了中国开源大模型在全球范围内的强大影响力。DeepSeek 等模型已经成为全球 AI 发展中绕不开的基础设施,无论是直接应用还是作为技术参照,都标志着中国 AI 技术从“追赶者”向“基础设施提供者”的角色转变。
本文系学术转载,如有侵权,请联系CVer小助手删文
后台回复:绘图神器,即可下载绘制神经网络结构的神器!
何恺明在MIT授课的课件PPT下载
在CVer公众号后台回复:何恺明,即可下载本课程的所有566页课件PPT!赶紧学起来!
CVPR 2025 论文和代码下载
在CVer公众号后台回复:CVPR2025,即可下载CVPR 2025论文和代码开源的论文合集
CV垂直方向和论文投稿交流群成立
扫描下方二维码,或者添加微信号:CVer2233,即可添加CVer小助手微信,便可申请加入CVer-垂直方向和论文投稿微信交流群。另外其他垂直方向已涵盖:目标检测、图像分割、目标跟踪、人脸检测&识别、OCR、姿态估计、超分辨率、SLAM、医疗影像、Re-ID、GAN、NAS、深度估计、自动驾驶、强化学习、车道线检测、模型剪枝&压缩、去噪、去雾、去雨、风格迁移、遥感图像、行为识别、视频理解、图像融合、图像检索、论文投稿&交流、PyTorch、TensorFlow和Transformer、NeRF、3DGS、Mamba等。
一定要备注:研究方向+地点+学校/公司+昵称(如Mamba、多模态学习或者论文投稿+上海+上交+卡卡),根据格式备注,可更快被通过且邀请进群
![]()
▲扫码或加微信号: CVer2233,进交流群
CVer计算机视觉(知识星球)人数破万!如果你想要了解最新最快最好的CV/DL/AI论文、实战项目、行业前沿、从入门到精通学习教程等资料,一定要扫描下方二维码,加入CVer知识星球!最强助力你的科研和工作!
▲扫码加入星球学习
▲点击上方卡片,关注公众号
整理不易,请赞和在看


