抖音跳舞不用真人出镜，一张照片就能生成高质量视频

2023年12月6日 13:27 • 未来科技

目前项目团队已经在HuggingFace中开放了在线体验的页面：

操作也是非常得简单，只需三步即可：

上传一张静态人物照片

上传想要生成的动作demo视频

调整参数，点击“Animate”即可

例如下面就是鄙人照片和一段近期席卷全球的《科目三》舞蹈片段：

也可以选择页面下方提供的模版进行体验：

不过需要注意的是，由于MagicAnimate目前过于火爆，在生成的过程中可能会出现“宕机”的情况：

即便成功“食用”，可能也得排大队。

本文来自微信公众号：量子位（ID：QbitAI），原文标题：《抖音跳舞不用真人出镜，一张照片就能生成高质量视频！字节新技术连抱抱脸CTO都下场体验了》，题图来源：视觉中国

看！现在正有四位小姐姐在你面前大秀热舞：

以为是某些主播在短视频平台发布的作品？

No，No，No。

真实答案是：假的，生成的，而且还是只靠了一张图的那种！

真实的打开方式是这样的：

这就是来自新加坡国立大学和字节跳动最新的一项研究，名叫MagicAnimate。

它的作用简单来说可以总结为一个公式：一张图片 + 一组动作 = 毫无违和感的视频。

然后啊，这项技术一经公布，可谓是在科技圈里掀起了不小的波澜，众多科技大佬和极客们纷纷下场耍了起来。

就连HuggingFace CTO都拿自己的头像体验了一把：

顺便还风趣地开了句玩笑：

这算是健身了吧？我这周可以不去健身房了。

还有相当与时俱进的网友，拿着刚出炉的GTA6（侠盗猎车手6）预告片中的人物玩了一把：

甚至就连表情包们也成了网友们pick的对象……

MagicAnimate可以说是把科技圈的目光聚焦到了自己身上，因此也有网友调侃说：

OpenAI可以休息一下了。

火，着实是火。

一张图即可生成一段舞

那么如此火爆的MagicAnimate，该如何“食用”？

话不多说，我们现在就来手把手地体验一次。

目前项目团队已经在HuggingFace中开放了在线体验的页面：

操作也是非常得简单，只需三步即可：

上传一张静态人物照片

上传想要生成的动作demo视频

调整参数，点击“Animate”即可

例如下面就是鄙人照片和一段近期席卷全球的《科目三》舞蹈片段：

也可以选择页面下方提供的模版进行体验：

不过需要注意的是，由于MagicAnimate目前过于火爆，在生成的过程中可能会出现“宕机”的情况：

即便成功“食用”，可能也得排大队……

没错！截至发稿，还是没有等到结果！

除此之外，MagicAnimate在GitHub中也给出了本地体验的方式，感兴趣的小伙伴可以试试哦~

那么接下来的一个问题便是：

怎么做到的？

整体而言，MagicAnimate采用的是基于扩散模型（diffusion）的一个框架，目的就是增强时间一致性、保持参考图像的真实性，并提高动画保真度。

为此，团队首先开发了一个视频扩散模型（Temporal Consistency Modeling）来编码时间信息。

这个模型通过在扩散网络中加入时间注意力模块，来编码时间信息，从而确保动画中各帧之间的时间一致性。

其次，为了保持帧间的外观一致性，团队引入了一种新的外观编码器（Appearance Encoder）来保留参考图像的复杂细节。

这个编码器与以往使用CLIP编码的方法不同，能够提取密集的视觉特征来引导动画，从而更好地保留身份、背景和服装等信息。

在这两项创新技术的基础之上，团队进一步采用了一种简单的视频融合技术（Video Fusion Technique）来促进长视频动画的平滑过渡。

最终，在两个基准上的实验表明，MagicAnimate的结果要远优于以往的方法。

尤其是在具有挑战性的TikTok舞蹈数据集上，MagicAnimate在视频保真度方面比最强基线高出38%以上！

团队所给出的定性比较如下：

以及与cross-ID的SOTA基线相比，结果如下：

One More Thing

不得不说，诸如MagicAnimate的项目最近着实是有点火爆。

这不，在它“出道”前不久，阿里团队也发布了一个名叫Animate Anyone的项目，同样是只要“一张图”和“想要的动作”：

由此，也有网友发出了疑问：

这似乎是MagicAnimate和AnimateAnyone之间的战争。谁更胜一筹？

你觉得呢？

论文地址：
https://arxiv.org/abs/2311.16498

参考链接：
[1]https://github.com/magic-research/magic-animate
[2]https://twitter.com/cocktailpeanut/status/1732052908227588263
[3]https://twitter.com/ProductHunt/status/1732116454647136449
[4]https://twitter.com/Gradio/status/1731992981715231162
[5]https://twitter.com/dylan_ebert_/status/1732152096621813954

本文来自微信公众号：量子位（ID：QbitAI）

声明：该内容为作者独立观点，不代表新零售资讯观点或立场，文章为网友投稿上传，版权归原作者所有，未经允许不得转载。新零售资讯站仅提供信息存储服务，如发现文章、图片等侵权行为，侵权责任由作者本人承担。如对本稿件有异议或投诉，请联系：wuchangxu@youzan.com

Like (0)

华为点火，厂商加速，激光雷达谁更强？

Previous 2023年12月6日 11:47

OpenAI重金押注的“类脑”AI芯片，到底是什么？

Next 2023年12月6日

水温80度：AI行业真假繁荣的临界点

我们从来没拥有过这么成功的AI主导的产品。

（这种分析统计并不那么准，但大致数量级是差不多的）

这两个产品碰巧可以用来比较有两个原因：

一个是它们在本质上是一种东西，只不过一个更通用，一个更垂直。

蓝海的海峡

未来成功的AI产品是什么样，大致形态已经比较清楚了，从智能音箱和Copilot这两个成功的AI产品上已经能看到足够的产品特征。

未来科技 2024年6月5日
ChatGPT、Perplexity、Claude同时“罢工”，全网打工人都慌了

美西时间午夜12点开始，陆续有用户发现自己的ChatGPT要么响应超时、要么没有对话框或提示流量过载，忽然无法正常工作了。

因为发现AI用久了，导致现在“离了ChatGPT，大脑根本无法运转”。”

等等，又不是只有一个聊天机器人，难道地球离了ChatGPT就不转了。

大模型连崩原因猜想，谷歌躺赢流量激增6成

GPT归位，人们的工作终于又恢复了秩序。

未来科技 2024年6月5日
ChatGPT宕机8小时，谷歌Gemini搜索量激增60%

ChatGPT一天宕机两次

谷歌Gemini搜索量激增近60%

ChatGPT在全球拥有约1.8亿活跃用户，已成为部分人群工作流程的关键部分。

过去24小时内提交的关于OpenAI宕机的问题报告

图片来源：Downdetector

ChatGPT系统崩溃后，有网友在社交媒体X上发帖警告道：“ChatGPT最近发生的2.5小时全球中断，为我们所有依赖AI工具来支持业务的人敲响了警钟。

未来科技 2024年6月5日
ChatGPT、Perplexity、Claude同时大崩溃，AI集体罢工让全网都慌了

接着OpenAI也在官网更新了恢复服务公告，表示“我们经历了一次重大故障，影响了所有ChatGPT用户的所有计划。Generator调查显示，在ChatGPT首次故障后的四小时内，谷歌AI聊天机器人Gemini搜索量激增60%，达到327058次。

而且研究团队表示，“Gemini”搜索量的增长与“ChatGPT故障”关键词的搜索趋势高度相关，显示出用户把Gemini视为ChatGPT的直接替代选项。

未来科技 2024年6月5日
深度对话苹果iPad团队：玻璃的传承与演变

iPad最为原始的外观专利

没错，这就是iPad最初被设想的样子：全面屏，圆角矩形，纤薄，就像一片掌心里的玻璃。

2010年发布的初代iPad

好在乔布斯的遗志，并未被iPad团队遗忘。

初代iPad宣传片画面

乔布斯赞同这一想法，于是快速将资源投入平板电脑项目，意欲打造一款与众不同的「上网本」，这就是iPad早年的产品定义。

iPad进化的底色

苹果发布会留下过很多「名场面」，初代iPad发布会的末尾就是一例。

未来科技 2024年6月5日
底层逻辑未通，影视业的AI革命正在褪色…

GPT、Sora均为革命性产品，引发了舆论风暴，但它在上个月发布的“多模态语音对谈”Sky语音，却由于声音太像电影明星斯嘉丽·约翰逊，被正主强烈警告，被迫下架。

华尔街日报也在唱衰，认为“AI工具创新步伐正在放缓，实用性有限，运行成本过高”：

首先，互联网上已经没有更多额外的数据供人工智能模型收集、训练。

03、

如果说训练“数字人”、使用AI配音本质上瞄向的仍是影视行业固有的发展方向，那么还有另外一群人试图从根本上颠覆影视行业的生产逻辑和产品形态。

但分歧点正在于此，电影公司希望通过使用AI技术来降低成本，但又不希望自己的内容被AI公司所窃取。

未来科技 2024年6月5日
KAN会引起大模型的范式转变吗？

“先变后加”代替“先加后变”的设计，使得KAN的每一个连接都相当于一个“小型网络”，能实现更强的表达能力。

KAN的主要贡献在于，在当前深度学习的背景下重新审视K氏表示定理，将上述创新网络泛化到任意宽度和深度，并以科学发现为目标进行了一系列实验，展示了其作为“AI+科学”基础模型的潜在作用。

KAN与MLP的对照表：

KAN使神经元之间的非线性转变更加细粒度和多样化。

未来科技 2024年6月5日
这个国家，也开始发芯片补贴了

//mp.weixin.qq.com/s/tIHSNsqF6HRVe2mabgfp6Q
[4]中国安防协会：欧盟批准430亿欧元芯片补贴计划：2030年产量占全球份额翻番.2023.4.19.https。//mp.weixin.qq.com/s/VnEjzKhmZbuBUFclzGFloA
[6]潮电穿戴：印度半导体投资大跃进，一锤砸下1090亿，政府补贴一半.2024.3.5https。

未来科技 2024年6月5日
大模型的电力经济学：中国AI需要多少电力？

这些报告研究对象（数字中心、智能数据中心、加密货币等）、研究市场（全球、中国与美国等）、研究周期（多数截至2030年）各不相同，但基本逻辑大同小异：先根据芯片等硬件的算力与功率，计算出数据中心的用电量，再根据算力增长的预期、芯片能效提升的预期，以及数据中心能效（PUE）提升的预期，来推测未来一段时间内智能数据中心的用电量增长情况。

未来科技 2024年6月5日
你正和20万人一起接受AI面试

原本客户还担心候选人能否接受AI面试这件事，但在2020年以后，候选人进行AI面试的过程已经是完全自动化的，包括面试过程中AI面试官回答候选人的问题，AI面试官对候选人提问以及基于候选人的回答对候选人进行至多三个轮次的深度追问。

以近屿智能与客户合作的校验周期至少3年来看，方小雷认为AI应用不太可能一下子爆发，包括近屿智能在内的中国AI应用企业或许要迎来一个把SaaS做起来的好机会。

未来科技 2024年6月4日

抖音跳舞不用真人出镜，一张照片就能生成高质量视频

相关推荐