{{!completeInfo?'请完善个人信息':''}}
单渠道依赖与尝鲜留存仍是下一阶段真考题。

2026年7月,AI产品榜(AICPB)出海增速榜上出现了一组反差。可灵AI月活1026万,环比下跌22.16%,排名第二十;PixVerse月活1742万,环比下跌6.6%,排名第十三。智象未来(HiDream.ai)的Vivago月活460万,环比增长17.1%,双月蝉联第一。
同一个榜单上,规模占优的两大头部产品增长节奏趋缓,一个体量更小的挑战者在加速上行。而增速最快的十款App里,占比最多的依然是AI情感陪伴,Vivago是唯一的AI视频生成类产品。当头部产品的用户基数已经铺开,AI视频工具的增长瓶颈到底在哪?Vivago的高增速,究竟是产品力驱动的增长,还是基数小、渠道红利未消退带来的短期现象?

2026年7月蝉联出海增速榜首 图源:AICPB

Vivago的增长更多来自基数较小的长尾市场 图源:点点数据
增长拆解:渠道红利,还是产品壁垒?

Vivago定位为面向社媒创作者的“一站式AI Agent创作平台”,目前已迭代至vivago R1,覆盖全球120多个国家和地区,5000万注册用户,百万级付费用户,2026年Q1营收已超2025全年总和。智象未来在三个月内密集完成三轮融资,累计超21亿元,投后估值突破10亿美元。
同为智象未来旗下的HiBurst作为TikTok官方Top5合作伙伴,让智象未来在TikTok上拥有了深度的平台理解。这种公司级的运营能力同时赋能HiBurst(B端营销)和Vivago(C端获客)两条线。这一点是Vivago区别于纯C端AI工具的优势:多数AI视频出海团队对TikTok的理解停留在“投放”层面,而智象通过B端业务积累了平台规则、算法偏好和内容趋势的一手经验,再反哺到C端产品的获客策略里。但渠道能力是双刃剑:它让Vivago的获客效率高于同行,也意味着它的增长高度依赖TikTok渠道,对于平台自身的变化更加敏感。
最具体的体现,就是Vivago的一次社媒裂变:去年底,Vivago团队从TikTok异常活跃的评论区发现“宠物跳舞”素材的爆款信号,并迅速做出反应,推出上线自研的3D功能,采取一系列针对性链式传播策略,并成功在2025年12月在社媒爆发。据36氪报道,截至2026年年初第一个月,Vivago凭借这次社媒流量拿下了1000+万下载,一度压过可灵。复盘这次增长,本质上是一次精准的社媒运营操作:发现趋势、快速响应、功能配合、流量承接。它证明的是Vivago团队的渠道执行力,这种打法可复制性很强。

智象未来发布一系列宠物跳舞制作教程 图源:智象未来
AI工具类产品的注册用户到活跃用户的转化率通常不高,“尝鲜用户”的留存是行业普遍难题。Vivago的增长曲线还处在前半段,真正的考验是尝鲜期过后,用户是否还愿意留下来。
在用户留存上,Vivago则打通了从生成到发布的链路,这在AI视频生成工具里比较少见。2026年1月,据极客公园报道,vivago.ai上线了TikTok美区授权发布功能,通过官方OAuth接口,Vivago同时支持创作者账号授权(内容侧)和店铺授权(电商侧),并将已授权账号“官方店铺/渠道/联盟创作者”分类管理。用户在vivago里做完视频,不用跳转别的平台,直接发布到TikTok,有效减少了用户流失,也意味着它的增长高度依赖TikTok单一渠道。

授权面向需要同时管理多个TikTok账号和店铺的商家/机构或C端创作者 图源:vivago.ai
但换个角度看,“生成+发布”的闭环本身就是TikTok生态里的标配能力。Vivago向剪映等成熟工具的标准看齐的同时,还是要面临真正的留存考验:用户发出去的视频数据,能不能反过来指导Vivago帮用户生成更好的内容?而除了获客、资源和变现等方面,Vivago在技术路线上,也确实相比同体量的产品抢占了一些先机。
“原生全模态”的行业共识
据报道,2026年8月17日,智象未来(HiDream.ai)正式发布HiDream-O1-World,定位为“全球首款原生全模态交互式世界模型”。

HiDream-O1-World让AI视频从“平面幻觉”升级成了“可操控的真实空间” 图源:ai_bot
世界模型在2026年集中爆发,国内外巨头几乎同步入局。海外阵营中,谷歌、AMI Labs和World Labs都推出了相关产品,国内腾讯也在四月推出了混元3D世界模型2.0(HY-World 2.0),阿里同日亮出主打实时交互的HappyOyster,一周后字节跟进,正式推出新一代3D生成大模型Seed3D 2.0。群雄逐鹿之下,各家的技术路线与侧重点并不相同,恰恰说明这一赛道尚无定论。
HiDream-O1-World的底层架构是智象未来自研的UiT(Unified Transformer)。2023年9月,智象就从60亿参数视觉多模态大模型起步,同时上线了图片模型和视频模型。2024年7月自研DiT(Diffusion Transformer)商用大模型发布,到2026年UiT架构成型,技术积累有近三年。
目前主流的多模态模型,文本、图像、视频各有各的编码器,各干各的,最后通过一个翻译层把信息拼起来。这种“拼积木”式架构的代价是:模态之间的理解是间接的,跨模态信息在翻译过程中会损耗。DiT的意义在于,它让AI生成图像和视频的能力不再有天花板,模型越大、喂的数据越多,生成质量就越好,而且不会因为架构瓶颈而停滞。
但DiT只换了生成端的心脏,理解端仍然是拼接的。于是智象的UiT更进一步,把图像像素、文本、视频、音频等所有原始信号直接映射进同一个共享Token空间,由同一套Transformer统一处理,“理解”和“生成”从训练之初就在同一个框架里完成,不再需要后期拼接。

AI进化为“懂世界的智能体”之前每一次架构跃迁,解决的是“理解得更深刻”
不过,UiT基于的“原生全模态”概念并非智象独有,当然也不是无需验证的护城河。2026年初,谷歌发布Gemini Embedding 2,将文本、图像、音视频、PDF融合进统一向量空间;英伟达推出Nemotron 3 Nano Omni,把全模态感知、理解、推理整合为单一模型。在这条路上,同体量的创业公司里,智象确实是动手较早的那一批,但UiT目前还在迭代过程中,其相对于拼接式架构的实际质量优势,需要更多产品端的数据来验证。成本优势会随开源模型成熟和算力降价而收窄,在技术迭代以月计的赛道上,新的技术前沿优势也可能被快速追平。
真正属于Vivago的,或许是一些更朴素的东西:在一个方向上走了将近三年的惯性、对长视频生成稳定性的持续打磨,以及在社媒创作场景中积累的垂类理解。当“生成好看的视频”这一维度正被模型趋同快速拉平时,“持续生成不出错、可交付的长链路内容”反而成了稀缺能力。智象的商业化逻辑也围绕这一点展开:以HiDream系列大模型为底座,在模型之上构建面向具体场景的智能体应用,帧赞、HiBurst和Vivago都是这套能力在具体场景中的产品化落地。

Vivago的AI工具箱里细分的功能矩阵 图源:Vivago.ai
但vivago强调的“协作”和“系统”目前也是行业中的共识之一。而当所有工具都在拼稳定性和具体交付能力时,产品之间的差异点就在于在“稳的代价是什么”:用户需要手动做多少事才能获得稳定结果?是每次生成都要重新描述角色特征,还是系统自动记住?是用户自己拼接片段,还是系统自动缝合?这些更加具体的、与创作者直接相关的体验细节,或许是需要Vivago和它背后的团队持续关注的问题。
写在最后
vivago的增长享受了尝鲜用户涌入、渠道先发优势的市场早期红利,但技术架构的深度和场景理解的精度才是未来的逐鹿之地。世界模型集中落地,谷歌、李飞飞World Labs、腾讯、阿里、字节几乎同步入局,正因为模型能力爆发性提升,AI视频生成工具正在从单点工具向创作系统演进,用户需求逐渐开始从“尝鲜”转向“生产依赖”。在技术以月为单位迭代的赛道上,能保持增速并非易事。智象三年走了一个正确方向,拿到了入场券。而能不能留在牌桌上,取决于接下来的产品迭代速度和场景理解深度。
原文链接:点击前往 >
文章作者:弹痕
版权申明:内容仅供网友参考学习。如有侵权,请联系客服,扬帆出海欢迎行业优质稿件投稿。扬帆出海为您提供中国互联网出海权威资讯,提升出海认知;对接全球企业合作资源,构建企业本地化壁垒;10万+出海从业者社群,帮助打通行业人脉。 更多资讯关注扬帆出海官网:https://www.yfchuhai.com/
{{likeNum}}
好文章,需要你的鼓励
已关注
关注