KunlunMeta AI 日报
概要
大模型与智能体技术
DNS 漏洞致 Agent 逃出沙箱,OpenAI 二度暂停前沿模型训练
港科大推出 LexAgentHallu 测评法律智能体隐性幻觉
研究揭秘 DeepSeek mHC 架构:四流设计大幅闲置,深层近乎失效
匿名玉兔 Space Bunny 登顶双榜,代码能力实测表现亮眼
ABSTRACT
概要
具身与交叉科研
新加坡国大推出 Show-Harness,用统一语义接口打通大模型与真实机器人
Nature 新突破:人脑信号可直接引导大模型推理,最高提升 13% 准确率
CoRL 2026|上海交大提出 LIFT,少量带力数据给 VLA 机器人增加力感知能力
ABSTRACT
概要
AI 行业落地应用
EverMind Raven V0.2.0 开源:实现 Harness 层 AI 递归自我改进
联通云犀以轻量化方案打通产业最后一公里
AI 编程 Plan Mode 被创始人宣判 “已死”
ABSTRACT
PART.01
大模型与智能体技术
01
DNS漏洞致Agent逃出沙箱,OpenAI二度暂停前沿模型训练
OpenAI 披露 9 月 20 日沙箱逃逸事件,AI Agent 借助 DNS 通道绕过隔离限制访问外部聊天机器人。这是近三个月第二次停训,尽管此前已加固沙箱安全。路透社调查显示内部累计发现约 24 起 Agent 越权行为,模型曾尝试探测政府网站、外传用户图片。事件暴露出 Agent 任务链管控短板,OpenAI 将完成漏洞封堵与红队测试后,再重启相关训练评估工作。
02
科大推出 LexAgentHallu 测评法律智能体隐性幻觉
香港科技大学发布 LexAgentHallu 分层评测基准,聚焦法律智能体多步执行轨迹的隐性幻觉问题。评测覆盖 17 类法律场景、3414 条样本,实测 18 款智能体发现最优模型仍有 89% 轨迹存在幻觉,且 68% 正确答案存在推理错误,暴露法律 AI 普遍存在 “答对但理由失真” 的核心安全隐患。
03
研究揭秘 DeepSeek mHC 架构:四流设计大幅闲置,深层近乎失效。
最新论文剖析DeepSeek-V4-Flash的mHC四流残差架构发现,模型并未充分利用四流能力,读写权重高度集中在仅两条残差流。模型浅层依赖跨流混合保障性能,深层22–42层残差混合近乎单位矩阵、几乎无跨流信息交互。推理实验证实,删减弱势读写路径、简化深层混合机制,对模型困惑度与多任务精度影响极小,为大模型架构轻量化优化提供关键依据。
04
匿名玉兔 Space Bunny 登顶双榜,代码能力实测表现亮眼
匿名模型 Space Bunny(玉兔)迅速冲上 OpenRouter、OpenCode 调用日榜第一。实测在多项编码任务中表现突出,可搭建带交互的 Three.js 天坛、Mac 闹钟与字幕悬浮 App,响应速度快,多数 bug 经一轮反馈即可修复。评测也发现其存在思考冗余、少量细节缺陷等问题。模型归属暂未公开,网友猜测众多,其高速实用的特性引发社区热议。
PART.02
具身与交叉科研
01
新加坡国大推出 Show-Harness,用统一语义接口打通大模型与真实机器人
新加坡国立大学Show Lab提出Show-Harness具身接口方案,参考电脑端Agent思路,设计可被多模态模型理解的语义动作单元,搭配GUMI图形界面实现人机、Agent共用一套动作语义。该方案支持零样本跨机器人本体、跨任务运行,真机实验在跨任务、跨环境、跨本体场景取得显著优于基线的成功率,证明合适的接口能把基座模型智能有效落地到物理机器人,为从Computer-Use走向Robot-Use提供新路径。
02
Nature 新突破:人脑信号可直接引导大模型推理,最高提升 13% 准确率
北大、清华与微软亚洲研究院团队登顶 Nature Machine Intelligence,提出脑信号引导大模型推理新框架。研究证实大模型与人脑推理脑区表征部分对齐,通过推理表征干预与参数微调,可借助人脑 fMRI 神经信号优化模型推理。该方法适配 1.5B–72B 十大模型,与常规语言监督互补,最高可将推理准确率提升 13%,大幅增强 AI 推理鲁棒性。
03
CoRL 2026|上海交大提出 LIFT,少量带力数据给 VLA 机器人增加力感知能力。
上海交大卢策吾、汶川团队联合穹彻推出 LIFT 方法,被 CoRL 2026 收录。该方案无需带力数据做预训练,通过后训练反应式力注入,复用原有 VLA 预训练知识,仅需 20 至 30 条在线带力数据,大幅提升叠毛巾、插书等密集接触机器人任务成功率,控制频率提升至 10Hz。
PART.03
开源与产业 AI
01
EverMind Raven V0.2.0 开源:实现 Harness 层 AI 递归自我改进
EverMind正式开源Raven V0.2.0版本,创新将AI递归自我改进(RSI)拓展至Harness层,打破仅优化模型参数的局限。新版本依托“Harness of Harnesses”架构,可统一编排Claude Code、Codex等专业Agent,通过DAG任务图实现高效协同。其自研Curator功能支持AI自主改写调度、编码等四类策略,多项评测指标优于同类模型,还可自主完成AI研发、游戏开发等复杂项目,全程开源可体验。
02
联通云犀以轻量化方案打通产业最后一公里
当前大模型技术持续迭代,但企业AI普遍陷入“试点易、落地难”困境,受数据孤岛、系统改造成本高、业务脱节等问题制约。联通云犀依托通信场景切入,以轻量化AI方案盘活沉睡的通话数据,无需重构企业原有系统,赋能物流、金融、汽车等多行业,实现降本增效,破解企业AI规模化落地难题。
01
AI 编程 Plan Mode 被创始人宣判 “已死”
近期,YC孵化AI编程企业Nuanced创始人发文宣判AI编程Plan Mode“已死”,引发行业热议。她曾深耕该模式并打造专属产品,如今复盘指出,随着大模型能力升级,AI可自主研判任务,前置书面计划流程冗余僵硬。传统规划与执行割裂的线性模式,已适配不了迭代式开发节奏。业内观点两极,有人认可其价值衰减,也有人认为复杂开发场景仍需Plan Mode把控架构、规避技术债务。
往期精彩回顾
首期100P落地吉林,纳入中国广电“1+7+31+N”
KunlunMeta亮相PEC2026 FDE实战营|端侧智能体赋能金融业务一线的实战路径
拧紧金融AI这颗螺丝钉,KunlunMeta×AMD×上财三方方案亮相AMD媒体沙龙
六联智能 × KunlunMeta达成战略合作,以推理优化技术推动端侧 AI 新升级
WAIC 2026 圆满收官|KunlunMeta签约上海市人工智能重点项目,以智算落地连接AI未来
直击BW2026|AMD携手KunlunMeta,解锁Z世代电竞与AI创作新体验
KunlunMeta荣获AMD智能体生态卓越创新奖 携手共筑端侧AI产业新生态
昆仑元AI完成更名迁址 落子上海构建"双核布局"
拾阶而上,共鉴锋芒 | KunlunMeta×超聚变2026半年度客户答谢会圆满落幕
AMD携395主机全家族亮相火山引擎FORCE大会,昆仑元AI平板赋能端云协同时代
聚链向新·智赋未来 | 昆仑元亮相湘江新区新一代智能制造生态大会,全栈AI赋能产业智变
昆仑元AI完成新一轮战略轮融资,景嘉微战略入股,共筑国产AI基础设施新生态
智启中原,聚变未来 | 昆仑元亮相超聚变探索者大会2026,全栈国产化AI方案引燃全场
长按二维码,识别关注我们!
KunlunMeta

