2023年,人工智能在各个领域产生了巨大影响。在今年的AI技术方面,重大的进步主要集中在对现有技术的改进,而不是像ChatGPT或之前的图像生成器那样带来创新。虽然没有太多惊艳的效果,真正的通用人工智能(AGI)仍然遥不可及,但今年标志着先前取得重大突破和更强大技术之间的中间阶段。为了展示这种演变,我们设计了一个可视化时间线,突出了今年对AI最显著的进展,它们塑造了AI的这一年。

Adobe Firefly:Adobe Firefly和生成式填充(Generative Fill)现在可以创建各种视觉内容,包括插图、艺术概念和图像处理。Firefly已与Photoshop整合,使得AI的力量可以广泛应用,并立即扩展到成千上万的用户。此外,文字效果功能的推出使得用户可以对词语和短语应用样式或纹理。
Midjourney:Midjourney的V.5模型标志着图像生成的一个里程碑,展示出更高的效率、连贯性和更高的分辨率。而最新的alpha版本Midjourney V.6引入了额外的增强功能,例如更准确的提示跟进、更丰富的模型知识以及文字生成绘制功能。
DALL·E 3:建立在ChatGPT的基础上,DALL·E 3简化了图像生成的过程,消除了复杂的提示词的需求。同时,ChatGPT不断根据用户反馈改进提示和调整图像。
Shutterstock.AI:这家图片库巨头集成了AI功能,允许用户将提示转换为可授权的图像。Shutterstock在AI伦理方面迈出了第一步,承认并奖励贡献艺术家。
Stability AI推出了全新的Stable Video Diffusion,这是一个强大的生成式视频模型,现已在GitHub上开源。Stability Video Diffusion模型在AI视频生成领域可能起到关键作用,与当前AI图像生成趋势相呼应。
Runway推出了Gen-2模型,用户可以通过文本提示、图像或其他视频快速生成完整的视频。
Pika吸引了50万用户,并每周生成数百万个视频。而Pika 1.0升级了AI模型,使用户能够以各种风格创建和编辑视频,包括3D动画、动漫、卡通和电影式。
Meta发布了PiCA(Pixel Encoder Avatar)模型,用于在视频中生成3D人脸,使我们更接近逼真的远程交流。
Bard和Gemini:Google的Bard将更多人性化的情感和情感注入到聊天机器人中。Google的Gemini已加入Bard聊天机器人并在多模态数据集上进行培训,成为OpenAI ChatGPT最接近的竞争对手,是最有能力的AI模型之一。
Grok:马斯克的初创公司xAI发布了Grok,一个有幽默感、叛逆并且能够即时获得知识的聊天机器人。Grok有潜力与OpenAI竞争,xAI声称Grok旨在解决其他AI系统拒绝回答的具有挑衅性的问题。
OverflowAI:Stack Overflow的OverflowAI通过AI驱动的搜索增强了知识管理,在Visual Studio Code和Slack中提供相关答案。
Lama 2:Meta发布了下一代开源大型语言模型Llama 2,展示了提高效率的性能。Meta经过调优的LLM在对话应用案例中性能得到改进,并在大多数基准测试中击败了其他开源模型。
GPT-4:OpenAI的GPT-4现在可以处理图像输入,生成字幕、分类、听和回应对话,并支持实时网络浏览。OpenAI还扩展了插件支持,丰富了开源竞争对手的生态系统。GPT-4是OpenAI在发展AGI道路上的下一步。
Mistral 7B:预估估值约20亿美元的Mistral AI公司推出了Mistral 7B,一个与GPT-4和Claude 2媲美的大型语言模型。Mistral AI强调开放技术方法,并免费提供其模型。
Mistral AI最新推出了Mixtral 8x7B,这是一个拥有46.7亿个参数的高质量模型,由专家混合构建(SMoE)。其开放的权重强调了在真实性和减少偏见方面的先锋性。

Segment Anything Model (SAM):由Meta AI推出的SAM是一个分割模型,无需额外训练即可对图像中的物体进行分割,展现了其高适应性。SAM在大规模数据集上进行了训练,展示了其在物体分割中的稳健性能。
Direct Preference Optimization (DPO):DPO成为了一种稳定且高效的方法,可以优化大规模无监督语言模型和将文本引导到图像模型的能力。它实现了对复杂强化学习(RLHF)进行精确控制的人类反馈。
Zephyr Direct Harmonic LM Alignment:Zephyr-7B通过Direct Preference Optimization(dDPO)实现了7亿个参数的聊天模型的基准,并且无需大量的训练。
Autonomous AI Agents:自主AI代理是一个明显的趋势,标志着先进和自主的AI系统的发展。研究表明,AI代理被认为是AGI的第一个征兆,因为它们能够根据用户的目标生成定制任务和指令,并自主地工作,直到目标完成。
EvoDiff:微软的开源AI框架EvoDiff用于快速、经济高效地生成蛋白质,有望推动治疗和工业应用的发展。
Stability Audio:Stability AI推出了一种工具,可以从简单的文本提示中生成短而高质量的音频片段。
OpenAI推出的新服务:OpenAI推出了GPT Store,以销售定制的GPT机器人,并推出了版权护盾来支付与侵权索赔相关的法律费用,以及无需编码的ChatGPT机器人构建器。
Stability AI开源重要模型:Stability AI开源了其StableLM-Alpha和Stable Vicuna模型,这两个模型在生成文本和代码方面表现出色。Stable Vicuna是第一个通过人类反馈强化学习(RLHF)进行训练的开源聊天机器人。此外,Stability AI还推出了SDXL Turbo,一种即时文本转图片生成模型。
重要的合作伙伴关系:在这个快速发展的领域中,一系列重要的合作伙伴关系塑造了未来的发展轨迹。以下是2023年最重要的AI合并和合作关系:
Stability AI和Init ML:Stability AI通过收购知名的编辑应用ClipDrop的公司Init ML迈出了重要的一步。他们的目标是将Stability AI的先进技术整合到ClipDrop生态系统中。这项合作已经促进了SDXL Turbo的开发。
Runway和Getty Images:Runway与Getty Images达成了战略合作伙伴关系,并推出了"Runway和Getty Images模型"(RGM),这是一个全新的视频生成模型。此模型结合了Runway的AI能力和Getty Images的授权创意内容库。该合作旨在创新内容创作工作流,使公司能够生成与其品牌形象相符的高质量、度身定制的影片。
Snowflake和Neeva:大数据平台Snowflake的主要参与者收购了被公认为使用生成式AI增强搜索体验的初创公司Neeva。Neeva最近关闭了其订阅式无广告搜索引擎,并承认说服用户尝试新搜索引擎的挑战。
OpenAI和Shutterstock:Shutterstock与OpenAI达成了为期六年的合作伙伴关系扩展协议。OpenAI获得了Shutterstock提供的高质量数据,以丰富其模型的训练数据集,包括图像、视频和音乐库的各种内容。同时,Shutterstock继续利用OpenAI的技术,推出了Shutterstock的AI图像生成工具。

关于人工智能法律方面的辩论:2023年的人工智能法律领域充满了不确定性和持续的争论。随着新问题的出现,对版权、企业政策和更广泛监管框架的讨论仍在继续,为塑造人工智能法律格局铺平了道路。以下是2023年最重要的法律问题:
欧盟AI法案:欧盟引入了全球首个全面规范人工智能使用的AI法案。该法案根据AI系统带来的风险对其进行分类并加以规范。尽管AI法案已获得了临时协议,但其实施面临着延迟,在2025年之前不会开始执法。
美国版权局对AI生成内容注册的立场:美国版权局果断决定拒绝为Midjourney AI算法生成的图像注册版权。这一决定确立了一个先例,宣称纯由AI生成的艺术作品不具备在没有人类参与的情况下获得版权保护的资格。同样,美国版权局就AI辅助作品发布了指导意见,澄清了人类使用AI工具创建的作品可能符合版权保护的资格。该指导意见确认应根据人类在创作过程中的决定性作用来评估使用AI工具创建的作品是否适用版权保护。
目前,现有法律体系尚未准备好承认AI生成作品的版权,因为AI是通过学习现有数据而生成的,这些数据的权利属于其他个人或机构,这给归属权的确定带来了挑战。预计明年将通过国家进行的调查推动公众参与来制定处理这一问题的惯例。在缺乏更广泛的公众参与的情况下,单独解决这个问题将变得非常困难。
麦肯锡发布了全面图表,展示了2023年在AI法律政策和监管方面的最重要进展。这种可视化呈现突出了2023年塑造AI法律格局方面的重大贡献。
人工智能的兴起引发了一系列迷人的辩论和讨论,人们在不确定性与迅速发展的AI格局中前行。随着行业的塑造,这些辩论变得不可避免,并带来了更多富有洞察力的对话和未来的挑战。
邀请好友购买逐浪AI套餐,体验MJ绘画,你和好友都将获得额外提问条数和绘画次数,更多详情请关注官方微信公众号

有任何问题也可直接联系我们客服微信
