技术动态
01
深度求索:发布DeepSeek V4.1 Flash模型
9月10日,深度求索正式发布DeepSeek V4.1 Flash模型,具备原生多模态视觉理解能力。
DeepSeek V4.1 Flash 为552B参数的MoE模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。模型已上线API并同步开源,腾讯WorkBuddy、CodeBuddy等作为官方合作伙伴全量接入。
模型开源链接:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
论文链接:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
原文链接>> DeepSeek V4.1 Flash:更强、更快、更普惠
02
蚂蚁灵波:开源三款世界模型
9月10日,蚂蚁灵波开源三款世界模型:LingBot-World 2.0 Small(1.3B)、LingBot-World 2.0 Bidirectional 和LingBot-World 2.0 Causal Pretrain。
LingBot-World 2.0 是一个实时交互世界模型。1.3B 小模型面向消费级单卡 GPU,可在单卡上实现实时世界生成;Bidirectional 与 Causal Pretrain 则进一步开放模型蒸馏和因果预训练能力。
项目主页:
https://technology.robbyant.com/lingbot-world-v2
Hugging Face:
https://huggingface.co/robbyant/lingbot-world-v2
魔搭社区:
https://www.modelscope.cn/collections/Robbyant/LingBot-World-V2
代码:
https://github.com/robbyant/lingbot-world-v2
技术报告:
https://arxiv.org/abs/2607.07534
原文链接>> LingBot-World 2.0 再开源三款模型
03
宇树科技:开源通用人形机器人基础模型 UnifoLM-WLA-1.0
9月10日,宇树科技开源通用人形机器人基础模型UnifoLM-WLA-1.0,参数量60亿,采用2500小时真机数据训练。
UnifoLM-WLA-1.0通过“具身推理+未来变化预测+动作学习”体系,实现单模型驱动64项任务(10项全身操作+54项桌面操作),支持二指夹爪和多类型灵巧手。其创新点在于将空间理解、交互预测与动作生成整合,采用离散动作标记技术解决连续控制问题。
项目主页:
https://unigen-x.github.io/unifolm-wla.github.io
原文链接>> 宇树通用人形基础模型全面升级重磅开源
04
京东:开源实时可交互世界模型 JoyAI-Echo WM
9月9日,在京东全球科技探索者大会(JDD)上,京东开源实时可交互世界模型JoyAI-Echo WM。
JoyAI-Echo WM能根据用户的移动和视角变化持续生成世界,同步生成720P视频、环境音、音乐和语音,并支持第一人称、第三人称及多轮连续交互,让AI生成的内容从“可以看”,进一步走向“可以进入、可以操作、可以听见”的全模态新阶段。
arXiv 论文:
https://arxiv.org/pdf/2608.23189
项目页面:
https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm
代码仓库:
https://github.com/jd-opensource/JoyAI-Echo
原文链接>> 京东开源JoyAI-Echo WM
05
面壁智能:开源 MiniCPM5-2B
9月8日,面壁智能联合OpenBMB开源社区开源MiniCPM5-2B,参数规模为2B,是一款高密度端侧语言基座模型。
MiniCPM5-2B核心创新在于支持混合思考模式、512K超长上下文处理,并通过Agent训练框架实现工具调用、深度搜索、代码生成等端侧Agent功能。同步开源UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609、UltraX4个数据集,以及自研强化学习框架Meshy与JustRL II算法。
MiniCPM5-2B 开源链接 (含模型与 UltraData 系列数据)
HuggingFace:
https://huggingface.co/collections/openbmb/minicpm5
GitHub:
https://github.com/OpenBMB/MiniCPM
Meshy 框架开源链接
GitHub:
https://github.com/OpenBMB/Meshy
博客:
https://maydomain.notion.site/meshy-blog-zh
JustRL II 强化学习算法
博客:
https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn
原文链接>> 面壁智能开源 MiniCPM5-2B
06
微信:开源通用多模态嵌入模型 WeMM-Embedding
近日,微信视觉团队开源通用多模态嵌入模型WeMM-Embedding,包含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。
WeMM-Embedding技术亮点包括单序列编码、嵌套表征学习和两阶段训练策略。模型已部署于视频号、公众号、朋友圈等推荐与搜索场景。
论文链接:
https://arxiv.org/abs/2608.24053
代码仓库:
https://github.com/Tencent/WeMM-Embedding
模型集合:
https://huggingface.co/collections/tencent/wemm-embedding
原文链接>> 微信自研多模态嵌入模型WeMM-Embedding 开源
行业动态
07
高德:推出新一代3D原生城市世界模型 ABot-Earth 0.7
9月10日,高德正式推出新一代3D原生城市世界模型ABot-Earth 0.7,并将这套世界模型进一步用进飞行街景2.0、导航Live、避雷指南等AI服务中。
ABot-Earth 0.7采用创新的3D原生技术路径,能从卫星图像或文字描述快速生成公里级3D城市场景,并支持从星球、城市一路到街景地标的连续生成。其核心突破在于直接用时空数据训练模型,建立三维空间的原生理解,输出可交互的数字孪生世界。
原文链接>> 从星球到街景一键生成!高德新世界模型来了
08
生数科技:发布面向机器人灵巧操作的自进化通用世界模型 Motus2
9月10日,在2026外滩大会现场,生数科技发布面向机器人灵巧操作的自进化通用世界模型Motus2。
Motus2 在统一的视频—动作模型中,将策略、世界模拟与价值评估纳入同一个闭环;不仅能够提出动作、预测动作结果,还能评估当前行动是否更接近目标,并利用反馈进一步优化后续策略;模型由此从单纯的行动生成,进一步走向行动的评估、反馈与自我改进。
原文链接>> 生数科技阐释通用世界模型下一程
09
OpenAI:发布生图模型 ChatGPT Images 2.5
9月8日,OpenAI发布生图模型ChatGPT Images 2.5,主打生成速度提升、局部编辑精准度增强和新增手绘草图功能。
ChatGPT Images 2.5生成速度最高比Images 2.0快50%。用户连续修改一张图片时,前面已经调整好的内容更容易保留下来;修改人物、产品或背景时,也更容易只改变指定部分。同时,用户可以直接画草图作为参考,也可以在图片上标记需要修改的位置。另外,ChatGPT增加了Sketch、Templates和图片评论功能。
原文链接>> ChatGPT Images 2.5来了
10
Meta:发布个人AI智能体 Muse
9月8日,Meta发布个人AI智能体Muse,面向美国18岁及以上用户开放,可通过iOS、Android、muse.ai以及WhatsApp使用,后续还将进入Meta的AI眼镜。
Meta给每个Muse配了一台独立的云端虚拟电脑,用户告诉它一个目标,它可以自己打开浏览器、搜索网页、填写表格、发邮件、预订行程、购买商品,还能在用户关闭App后继续处理任务。更进一步,Muse会主动提醒用户、拆解长期目标、继续推进后台任务,还可以生成网页、PDF、文档和交互式工具。
原文链接>> 扎克伯格“爆肝”美国贾维斯
11
腾讯文档:正式推出「AI 工作台」
9月8日,腾讯文档AI服务全端升级,正式推出「AI 工作台」。
AI工作台基于WorkBuddy提供的Agent内核框架,结合腾讯文档自研的高性能编辑引擎及文档、表格、PPT等品类专业Skill,让AI能够理解并操作真实文件,进入办公任务的完整流程。从资料导入、内容生成,到人机共创、反复打磨、任务执行、文件管理和成果交付,一条完整的工作链路,都可以在AI工作台中持续完成。
原文链接>> 腾讯文档「AI 工作台」上线
12
千问办公:推出「多人工作台」
9月7日,千问办公推出「多人工作台」。
用户简单描述需求,即可生成并发布一个最多支持百人同时在线协作的网页,承载复杂的业务流程。该功能适用于活动组织、家校协同和企业协作等场景,可解决定制软件成本高、开发周期长和不够灵活的难题。目前,用户可从千问办公首页下方功能入口直接体验。
原文链接>> 千问办公推出“多人工作台”
政策趋势
13
工信部:印发《“人工智能+软件”专项行动实施方案》
9月11日,工信部印发《“人工智能+软件”专项行动实施方案》,旨在推动软件产业与AI深度融合。
《方案》提出2028年和2030年两个阶段目标,重点培育智能编程工具、智能体软件等新业态,覆盖2万家规上企业,打造100个行业标杆应用。政策强调通过开源社区建设、算力支持和人才激励加速转型,并特别关注工业软件智能化,如推动EDA工具与AI结合。
原文链接>> https://www.cnii.com.cn/gxxww/dzxx/202609/t20260911_759453.html
14
北京经开区:印发《北京经济技术开发区关于支持人工智能原生人才发展的若干措施》
9月7日,北京经济技术开发区管理委员会印发《北京经济技术开发区关于支持人工智能原生人才发展的若干措施》,是针对人工智能领域人才的专项政策,覆盖创业、青年就业和生态培育三大方向。
《措施》分为8项具体措施,为顶尖科学家、技术骨干、超级个体等提供最高500万元的资金支持,并配套算力、研发空间等资源。特别面向青年人才推出实习补贴和就业奖励,同时鼓励举办开发者活动(最高补贴100万元),推动开源协作。
原文链接>> https://kfqgw.beijing.gov.cn/zwgkkfq/2024zcwj/202609/t20260907_4853819.html
15
甘肃:印发《甘肃省“人工智能+教育”行动计划(2026-2030年)》
近日,甘肃省教育厅等五部门印发《甘肃省“人工智能+教育”行动计划(2026-2030年)》,目标在2030年建成西部人工智能教育示范区。
《计划》提出2027年秋季起中小学每学年开设8课时AI课程,到2030年实现教师人机协同教学全覆盖,重点建设45所基地校、打造1000个应用场景,并推动高校增设20个AI相关专业。计划还强调通过算力平台、智能学伴等技术手段提升教育公平与质量,同时配套师资培训、伦理安全等保障措施。
原文链接>> http://jyt.gansu.gov.cn/jyt/c020802/202608/174386514.shtml
声明:资料素材均来源官方媒体/网络,如有侵权,请联系删除。
✦
✦
END
南京新一代人工智能研究院
Nanjing Research
Institute of Next-generation Artificial Intelligence
南京新一代人工智能研究院,是中国信息通信研究院在人工智能、大数据领域投资组建的控股企业,是江苏省人工智能产业公共技术服务平台的落地运营单位。
研究院以“服务国家战略实施,促进地方产业升级”为导向,在人工智能和大数据领域,开展前沿技术研究、标准制定、评测工具开发、实验能力建设等工作,可为企业提供全方位的诊断、咨询、培训、评估服务。
联系方式
吴老师 17788386765(微信同号)
杨老师 15221125491(微信同号)

