
模型架构与核心能力升级
Agent 适配与兼容性优化
基准测试性能表现
Terminal Bench 2.1: 82.7
NL2Repo: 54.2
Cybergym: 76.7
DeepSWE: 54.4
Toolathlon verified: 70.3
Agent Last Exam: 25.2
Automation Bench (Public): 25.1
DSBench-FullStack: 68.7
DSBench-Hard: 59.6
V4 系列预览版回顾与技术突破
Pro 预览版性能对标
长上下文效率优化
定价策略与成本控制
行业观察:从价格战到能力战

