导读
国产大模型纷纷自称“第一”,究竟孰强孰弱?字节跳动推出扣子模型广场,开启全民投票模式,让大众成为评判标准。这一举措旨在打破大模型生态的“黑盒”状态,推动其从玄学走向科学,核心在于解决应用落地的确定性问题。
从概念到落地:确定性是大模型的关键一步
近期,笔者走访了百余位人工智能应用开发者,其中不乏像张老这样的行业先驱。作为亲历过计算机发展早期的资深专家,张老对当前大模型的爆发既兴奋又担忧。他指出,舆论热闹背后,真正具备实用价值的发明寥寥无几。
张老以计算机发展史为例:早期王安发明的 Wang2200 虽功能超前,但因稳定性差且与主流 IBM 路线不兼容(即“黑盒子”),最终未能获得市场广泛认可;而稍晚推出的 IBM 5100 凭借稳定性和兼容性成为了 PC 时代的开端。
在张老看来,当前大模型生态正面临同样的两大挑战:结果不稳定与系统黑盒化。只有解决这两个问题,大模型才能从“厉害”变得“好用”。
大模型生态面临的两大核心挑战
产出结果的稳定性不足
尽管大模型被赋予无所不能的期待,但幻觉问题依然普遍存在。许多垂直领域的微调模型在实际表现上甚至不如传统的知识图谱。SaaS 厂商在接入大模型后常发现效果不理想,导致用户不敢依赖 AI 生成日报、周报或简历,因为人工修正的时间成本往往高于直接撰写。
“黑盒子”效应加剧使用难度
当前多数对话式大模型高度依赖复杂的 Prompt 工程。创业者反馈,当模型无法解决问题时,试图通过增加提示词细节来优化,往往导致结果更加混乱。这种高门槛与大模型降本增效的初衷背道而驰。B 端客户尤其关注输出的确定性,不稳定的数据会导致关键时刻需重新编写,严重阻碍了商业化进程。
手搓 Bot:扣子 AI 工作坊探索真实场景
大众市场不关心技术是否高科技,只关注能否解决实际问题。大模型生态要普及,必须大幅降低使用门槛并提高确定性。
目前,降低门槛的主流路径是 Agent(智能体),但现有的“智能体”概念往往过于科幻或模糊。更准确的理解应是“人设”:若仅靠 Prompt 设定一个哈佛教授人设,它可能只会模仿口吻而无法高质量完成任务。Prompt 越复杂,输出反而越不可控。
相比之下,扣子平台侧重于解决“确定性”问题。扣子将自身定位为新一代一站式 AI Bot 开发平台。与简单的 Agent 不同,Bot 支持预设工作流、插件、数据库及长期记忆。例如在创作公众号文章时,Bot 可自动执行检索、提纲、修改、核实等复杂步骤,其输出质量远超单纯依赖 Prompt 的 Agent。
Bot 与 Agent 的最大区别在于确定性。扣子通过可视化的工作流(Workflow),让开发者能像拼拼图一样“手搓”出精准的小程序。这种低代码模式不仅降低了开发门槛,还支持将 Bot 分发至微信、飞书、抖音等多渠道,真正实现了从开发者生态向大众创新生态的转变。
最低门槛的比拼:扣子模型广场重塑评估标准
伴随扣子 AI 工作坊的开展,扣子模型广场正式上线。该平台不限定单一基座模型,而是接入了通义千问、智谱 GLM、MiniMax、月之暗面、百川等国内主流大语言模型,旨在构建场景丰富的超级生态。
针对开发者难以选择模型的痛点,扣子推出了直观的“模型对战”功能,包含三种模式:
- 指定 Bot 对战:用户固定一个 Bot,切换不同底层模型进行测试,帮助开发者根据需求选定最佳模型。
- 随机 Bot 对战:系统随机分配模型,普通用户可在体验有趣 Bot 的同时,直观感受不同模型的能力差异。
- 纯模型对战:剥离具体应用场景,直接对模型本身进行双盲测试与投票,揭示模型真实性能。
过去,大模型厂商多依赖自建榜单或特定题库刷分,缺乏客观统一的评测尺度,导致生态处于“黑盒”状态。扣子模型广场通过公开投票机制,将评判权交给大众。这种低成本、低门槛的 PK 方式,不仅为开发者节省了测评时间与资金,更迫使厂商回归实际应用效果,用真实的用户体验作为衡量大模型优劣的最佳标尺。

