大数跨境

日本首款“自研”大模型实战:连税率题都算错了?

日本首款“自研”大模型实战:连税率题都算错了? 羽飞智能
2026-06-24
1
导读:日本发布全自研大模型PLaMo 3.0,不仅自造AI 芯片,更获日本政府背书。这款主打性价比的本土模型,背后隐藏着怎样的全球 AI 区域化趋势?中国出海企业又该如何错位竞争?

点击上方蓝字“羽飞智能”关注我们

6月22日,日本一家公司发布了一款从零自研的大模型 PLaMo 3.0 Prime,主打日语能力强、价钱低,还在不少日语评测里被拿来和全球大模型同台比较。它到底什么水平,我登进去,连出四道题考了它——有亮眼的,也有一道答错的。

一、先认识这个“日本自研”

它最大的标签是从零自研:完全从头训练,而非基于海外开源模型修修补补。出品方是日本的 Preferred Networks,这家公司连 AI 芯片都自己造,从芯片、算力到模型一条龙。这次它给了两套模式,一套是肯花时间慢慢推理的“长考”,一套是图快的普通模式;一次能读的上下文长达 25.6 万字符,还支持调用外部工具,奔着做能自己干活的智能体去的。

来头也不小。它被日本数字厅的政府采购项目选中,背后有经济产业省的扶持和官方机构提供的数据,是官产学一起推的成果。羽飞在日本做应用,这类“够用又便宜的本土模型”,是出海日本时绕不开的一类对手。

二、公开评测里,它和全球大模型怎么比

官方将 PLaMo 定位在“同价位、同体量”这一档,对手包括:对手有美国 OpenAI 的 GPT-5.4 Mini、Anthropic 的 Claude Haiku 4.5,开源一侧有 OpenAI 的 gpt-oss-120b、中国阿里的 Qwen3.6-27b。官方称,在日语指令遵循、对话、调用工具、医疗、写代码、安全这些项目上,它与这几款持平,个别更好。更高一档的 DeepSeek、GPT-5.5 等顶级模型,它坦言还有差距。
 看这些数据时,有两点要留意。一是这些数字多为官方自评,且用的主要是日语基准——比如日本医师国家考试、日本法令问答、日语写作评测,本土色彩浓;放到面向全球的通用排行榜上,它的名次并不靠前。二是各家测评口径不同,分数高低只宜参考,不适合直接横比。官方也没回避短板:联网检索、长上下文、数学推理、本国法令这几项仍然落后。这些都是纸面分数,于是我自己去考了它几道实活。

数据来源:Preferred Networks 官方技术博客《PLaMo 3.0 Prime 发布》、日本 ITmedia,均为 2026.6.22。数字为官方披露口径,含自评成分。

三、我连考了它四道题

登录进去是熟悉的对话框,不过它默认开着一个叫“长考”的开关。我给它出了四道题,看看这日本自研的“本土脑瓜”到底灵不灵。

第一题,考商务情商。
要求写一封日语商务邮件:商品因暴雨延期一周,要致歉,还要告知新的交货期,必须用敬语,限制在150字以内。
它思考了20秒,写出来的邮件挑不出毛病:标题规范,敬语的开头结尾都很得体,道歉、解释原因、给新日期,这三个要点一个不落,字数也卡得很准。评价:地道,像个老练的日本职场人。

第一题实测对话原样还原(本人 2026.6.23 在该模型的对话页操作)。

第二题,考算账能力。
出了一道进货的数学题:甲料180日元一个,月进3万个;乙料240日元一个,月进1.5万个。求当月花了多少钱,两者的数量比例是多少。
4秒钟就给出了答案:合计900万日元,比例是2:1,解题步骤列得清清楚楚。评价:反应快,算得准。

第二题实测对话原样还原(本人 2026.6.23 在该模型的对话页操作)。

第三题,考常识细节(翻车了)。
我问:在便利店买便当,如果我说“在店里堂食”,税率会不会变?
它回答:不变。
这是一个硬伤。实际上日本有规定:外带食品税率是8%,但如果坐在店里吃,税率立马跳到10%。它日语写得再溜,这种本国最基本的税务细节却没搞对。评价:关键时刻掉链子,这地方得留个人工复核。

第三题实测对话原样还原(本人 2026.6.23 在该模型的对话页操作)。

第四题,考语言转换。
把一句对客户的口语,改成更得体、更客气的商务敬语。
它只用了5秒,就给出了标准的教科书式说法。评价:稳。

第四题实测对话原样还原(本人 2026.6.23 在该模型的对话页操作)。

最后说说它的“长考”模式。
根据日本技术媒体的数据,如果关掉“长考”,一个简单问题3.8秒就答完;打开“长考”,时间会涨到22.7秒。这多出来的时间,就是它在多花十几倍的算力仔细思考。
实测发现,在写代码这类复杂任务时,“长考”版确实能避开普通版容易写错的坑。一句话总结:普通写邮件、算账它很稳,但涉及本国法规细节可能会出错。那个“长考”功能虽然慢,但在处理复杂难题时很有用。

四、对中国企业,能看出什么

第一,全球正在出现“区域化”的 AI 基础设施,不再是一家独大。以前我们谈 AI,总觉得是通用的、全球一体的。但 PLaMo 的出现揭示了一个新趋势:AI 基础设施正在“国别化”。日本不仅在做软件,连芯片、算力、数据都试图捏在自己手里,建立一套完全独立的系统。这不仅仅是为了“懂日语”,更是为了在数字时代掌握话语权。这对中国企业的启示是:未来的全球市场,很可能被分割成美、中、日等几套互不兼容的生态。出海时,我们不能只带着一套通用方案去打天下,而要意识到,我们面对的是一套被当地政策强力保护的“主场作战”体系。

第二,技术比拼正在从“高智商”转向“高情商”和“实用性”。PLaMo 这种本土模型,虽然数学推理可能不如美国顶尖模型,但它胜在“懂规矩”——知道日本商场的敬语怎么用、知道当地的合规红线在哪。这说明全球 AI 的应用方向正在变:对于大多数行业来说,一个完全懂当地风俗、价格便宜、出错少的中等水平模型,远比一个智商极高但“水土不服”的天才模型更受欢迎。 对中国厂商而言,如果在“深谙当地商业规则”这一点上输给本土玩家,仅靠“技术强”很难在当地站稳脚跟。

第三,合作比单纯的“卖模型”更有机会。日本政府扶持 PLaMo,核心诉求是安全和自主。这意味着,单纯靠卖海外 API 接口会越来越难,因为谁都不想把核心数据交给国外的黑盒子。未来出海的机会,在于“做深嵌入”——不是去替代对方的本土模型,而是把自己的技术变成对方生态里的一个插件或组件。比如,既然 PLaMo 算账容易出错,那就专门做一个擅长复杂逻辑计算的模块“嵌入”进去。在全球格局日益割裂的今天,做一个不可替代的“零部件供应商”,比做一个随时可能被挡在门外的“成品商”要安全得多,也更有前途。

本文事实核实于 2026 年 6 月:该模型发布信息、性能对标与短板自述据 Preferred Networks 官方技术博客及新闻稿(2026.6.22)、日本 ITmedia(2026.6.22);延迟与算力等底层数据据日本技术媒体开发者实测(2026.6.22);四题对话为本人 2026.6.23 实测,结果可能随版本变化。消费税轻减税率(外带8%、堂食10%)为日本 2019 年 10 月起施行的现行制度。文中不含羽飞客户数据,亦无外部链接。


【声明】内容源于网络
0
0
羽飞智能
1234
内容 98
粉丝 0
羽飞智能 1234
总阅读27
粉丝0
内容98