大数跨境

对话刘靖康:镜头之外的「智能」和「审美」,才是 Camera Agent 的主战场

对话刘靖康:镜头之外的「智能」和「审美」,才是 Camera Agent 的主战场 极客公园
2026-08-06
12
导读:「前轻后重」,传统路径正在往 AI 走。

「前轻后重」,传统影像路径正加速向 AI 演进。
策划、整理 | 曹思颀
编辑|万户

未来的影像设备将呈现「前轻后重」的形态。这是影石 Insta360 创始人刘靖康在 AGI Playground 2026 上对行业趋势的核心判断。影石近期提出的「打造 Cameraman」愿景,旨在通过「极简操作 + 优质交付」重塑影像体验,其本质可被视为一种「Camera Agent」。

尽管让设备在通用场景中完全自主移动仍具挑战,但 Cameraman 未必需要通用的大脑。对于生活记录而言,「审美在线」比单纯执行标准化任务更为关键。目前,影石已尝试通过云端提供 AI 剪辑服务,收费标准为 6 元/条。灰度测试两个月内完成数十万条剪辑,导出率超 50%。

以下是影石 Insta360 创始人刘靖康(JK)与极客公园创始人张鹏的深度对谈内容。

01 Cameraman:核心不是拍摄,而是结果交付

张鹏:Insta360 将产品使命从提供「camera」升级为提供「Cameraman」,这一变化意味着什么?

刘靖康:这一构想始于 2019 年。当时我们发现,虽然穿越机拍摄的镜头极具美感,但操控门槛极高。由此推导出的核心问题是:如何让普通人也能轻松获得高质量画面?

消费者真正的需求并非操作机器,而是获取优质的照片和视频。如同聘请专业摄影师跟拍,用户无需亲自动手即可获得理想素材,这才是影像体验的上限。

张鹏:为实现全自动拍摄,你们拆解出了哪些技术方向?

刘靖康:主要聚焦三大技术方向:

  • Imaging(眼睛):储备各类镜头、传感器及影像调校技术。
  • AI(大脑):自 2018 年起布局自动剪辑,让机器理解用户意图,学习最佳构图裁切。
  • Robotics(身体):构建移动平台。无人机实现户外自由移动,云台技术打破取景角度限制。

经过多年技术储备与变现验证,如今硬件零件已齐备,当前的战略重心是整合这些能力,拼凑出真正的「大脑」。若「Cameraman」概念解释成本过高,称之为「Camera Agent」或许更为直观。其核心价值不在于操作过程,而在于自动完成高质量影像的「交付」。

02 「前轻后重」:传统路径正在往 AI 走

张鹏:在大模型与云端发展的背景下,Imaging 这条线发生了哪些显著变化?未来格局如何?

刘靖康:技术路线已发生范式转移。以降噪为例,过去依赖 Sensor 到 ISP 的传统 CV 方案,而自 2019 年起,我们采用 AI 端到端模型,显著提升了夜景表现。此外,端到端的 Tone Mapping(色调映射)也让色彩表现实现飞跃。

更深层的变化在于 Color Grading(调色)。通过模型直接处理,可以实现端侧硬件无法达成的光晕、暗角及图像分层效果。这意味着相机开发可能出现新范式:前端硬件可以更轻、更便宜,不再过度依赖昂贵的光学组件,算力与算法的重心将向后端转移。

张鹏:这是否意味着镜头或光学不再是设备的灵魂?

刘靖康:传统技法仍有受众,但对大多数用户而言,轻便且画质优异的设备更具吸引力。当然,超长焦细节等场景目前 AI 尚难完美弥补,且云端生成的异步性与相机「即拍即得」的需求存在矛盾。随着芯片制程升级,部分云端能力将回归端侧。

结论是明确的:传统的路径正在往 AI 走。例如虚化效果,传统光学受限于物理底数和光圈,而 AI 生成能模拟出自然且高质量的虚化。未来消费模式将分化:一部分用户倾向低硬件成本加订阅服务,另一部分高频刚需用户则可能选择一次性买断算力。

03 AI 也会成为影像内容的消费者,但不一定是坏事

张鹏:Cameraman 是否需要在 Action 层面具备具身智能,即在拍摄和行动上也具备「人」的能力?

刘靖康:目前的无人机形态 Cameraman 已具备初步的「小脑」功能,能够进行 360 度环境感知、主体识别及轨迹规划。此外,还存在纯粹数据层面的「运动」,即在全景数据中通过裁切实现焦点移动。

相比地面移动,无人机在空中的障碍物较少,实现难度相对较低。而在室内复杂场景中,拍摄机器人的通过性挑战远大于扫地机器人,因此双足设备并非当前的最优解。

张鹏:具身智能的发展是否改变了数据采集的需求?

刘靖康:目前行业在数据采集路径上尚未收敛,存在第一人称、第三人称、全景等多种方案,甚至有不采集数据直接从视频学习的流派。我们保持密切观察,担心若纯视频学习路径跑通,前期采集的素材价值可能会降低。

张鹏:如果未来机器人成为影像内容的主要消费者,行业会发生什么变化?

刘靖康:影像服务于人类的记录需求,这一核心不会因 AI 而改变。人们记录美好时刻是为了回忆或分享,机器无法替代人类的情感体验。AI 主要在「分享」(作为效果放大器)和「创作」(替代部分商业广告制作)环节发挥作用。

虽然会出现机器人消费内容的情况(如用于生产力分析),但在娱乐和情感共鸣领域,人类依然是核心受众。工作时间的减少反而可能增加人类消费内容的时间,这对内容产业并非利空。

04 Cameraman 需要一个「有审美」的专用大脑

张鹏:未来影像设备会走向 All-in-One,还是会在特定场景做到极致?

刘靖康:影像品类的特殊性决定了形态的多样性。根据视角不同,至少分为三类:

  1. 第一人称视角(POV):如眼镜、拇指相机,适合运动场景。
  2. 第三人称视角:解放双手,由独立设备(如无人机)自主拍摄。
  3. 常规视角:手机或手持相机拍摄。

不同焦段服务于不同的叙事需求。全景适合记录环境,长焦适合特写,而第三视角的运动镜头则是独特的语言。因此,相机像汽车一样,虽核心功能一致,但会衍生出多种分支,难以由单一设备统摄。

张鹏:影像行业的「大脑」应该是通用的还是专用的?

刘靖康:虽然通用大模型可能覆盖大部分场景,但从商业竞争角度看,企业倾向于构建拥有独家数据和独特技能的专用模型,以实现差异化增值。特别是在审美层面,通用模型难以完全满足个性化需求。

目前的自动剪辑基于「公约数审美」,通过提供多个选项供用户选择来提升满意度。未来的方向是基于用户习惯进行千人千面的推理,但这受限于用户编辑视频的数据量较少,命中率仍存在隐形上限。

张鹏:云端剪辑服务的占比会越来越高吗?

刘靖康:这是必然趋势。用户愿意为节省后期时间付费。目前 6 元/条的云端服务导出率已超 50%,证明了市场需求。未来计算平台将多元化,包括云端、端侧硬件、手机及 NAS,具体取决于算力成熟度与用户体验的平衡。

张鹏:审美具有高度个性化,AI 如何确保交付质量?

刘靖康:审美确实难以量化。就像汽车设计,最终往往取决于决策者的审美取向。在 Cameraman 的演进中,我们将持续探索如何在标准化效率与个性化审美之间找到最佳平衡点。

*头图来源:AGI Playground 2026
【声明】内容源于网络
0
0
极客公园
用极客视角,追踪你最不可错过的科技圈。
内容 932
粉丝 0
极客公园 用极客视角,追踪你最不可错过的科技圈。
总阅读42.6k
粉丝0
内容932