Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: STIV – 苹果公司推出的视频生成大模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > STIV – 苹果公司推出的视频生成大模型
AIGC 资讯

STIV – 苹果公司推出的视频生成大模型

站外新闻
最近更新: 2026年7月10日 下午1:18
SHARE

STIV是什么

STIV(Scalable Text and Image Conditioned Video Generation)是苹果公司推出的视频生成大模型。STIV拥有8.7亿参数,能处理文本到视频(T2V)和文本图像到视频(TI2V)任务,基于联合图像-文本分类器自由引导(JIT-CFG)提升视频生成质量。STIV模型基于PixArt-Alpha架构,融合时空注意力机制、旋转位置编码(RoPE)和流匹配训练目标,增强视频生成的稳定性和效率。STIV支持多种下游应用,如视频预测、帧插值和长视频生成等。

阅读目录
  • STIV是什么
  • STIV的主要功能
  • STIV的技术原理
  • STIV的项目地址
  • STIV的应用场景

STIV

STIV的主要功能

  • 文本到视频(T2V)和文本图像到视频(TI2V)生成:STIV能根据文本提示或结合文本和初始图像帧生成视频内容。
  • 多模态条件支持:模型支持基于文本和图像的条件进行视频生成,增强视频内容与输入条件的一致性。
  • 视频预测:模型对视频未来帧进行预测,适用于自动驾驶和嵌入式AI等领域。
  • 帧插值:在给定的帧之间生成中间帧,提高视频的流畅度和连续性。
  • 多视角生成:从单一视角生成视频的新视角,增强视频的立体感和真实感。
  • 长视频生成:基于关键帧预测和帧插值技术,生成更长时长的视频内容。

STIV的技术原理

  • Diffusion Transformer(DiT):基于DiT架构,能有效处理时空数据。
  • 帧替换:在训练过程中,将噪声帧替换为无噪声的图像条件帧,增强视频生成的准确性和一致性。
  • 联合图像-文本分类器自由引导(JIT-CFG):一种无分类器引导技术,调整文本和图像条件的权重,优化视频生成过程。
  • 时空注意力机制:基于分解的时空注意力机制,分别处理空间和时间维度的特征,提高模型的效率和效果。
  • 旋转位置编码(RoPE):RoPE增强模型处理相对时空关系的能力,更好地适应不同分辨率的生成任务。
  • 流匹配训练目标:用流匹配目标替代传统的扩散损失,实现更优的条件最优传输策略,提升生成质量。

STIV的项目地址

  • HuggingFace模型库:https://huggingface.co/papers/2412.07730
  • arXiv技术论文:https://arxiv.org/pdf/2412.07730

STIV的应用场景

  • 娱乐与社交媒体:用户生成个性化的视频内容,如舞蹈、旅行或日常生活的短视频,在抖音、Instagram等社交平台上分享。
  • 广告与营销:企业创建动态的广告视频,根据产品特点或服务优势快速生成吸引人的视频内容,提高广告的吸引力和转化率。
  • 教育与培训:教育机构生成教育视频,如模拟实验过程或历史事件,为学生提供更加直观和互动的学习体验。
  • 新闻与报道:新闻机构将新闻报道转化为视频内容,快速生成新闻故事的可视化呈现,提高新闻的传播效率和观众的理解度。
  • 自动驾驶与仿真:自动驾驶技术公司生成各种交通场景的视频,测试和训练自动驾驶系统的决策和反应能力。
KHOJ – 开源 AI 个人化助手,一站式知识管理工具
YOLOv9 – 新一代高效的实时目标检测系统
腾讯开源Covo-Audio:70亿参数端到端语音大模型,挑战GPT-4o的实时对话新标杆
MemPrivacy:记忆张量与荣耀AI联合开源,端云协同隐私保护框架,如何为Agent长期记忆筑牢安全防线?
D-Edit – 基于图像、文本、掩码的多功能图像编辑框架
分享
Email 复制链接 打印
Share
上一篇 DiffSensei – AI 漫画生成框架,能生成可控的黑白漫画面板
下一篇 SynCamMaster – 快手联合浙大、清华等机构推出的多视角视频生成模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯
颠覆影视创作!字节跳动王牌模型Seedance 2. 5 正式发布, 30 秒一镜成片时代来了
AIGC 资讯
全息流体渐变通用占位特色图
我国人工智能迎来全产业链突破,将加快《人工智能法》立法
AIGC 资讯

相关推荐

全息流体渐变通用占位特色图
AIGC 资讯

MCP初创公司Runlayer指控Rippling涉嫌盗用其产品创意

站外新闻
AIGC 资讯

DynaSaur – Adobe 推出的大语言模型代理框架

站外新闻
全息流体渐变通用占位特色图
AIGC 资讯

宇树G1人形机器人首次完成活体动物手术,远程操控切除猪胆囊

站外新闻
AIGC 资讯

Hallo – 复旦百度等开源的AI对口型肖像视频生成框架

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney GPT Image 2 prompt AI Agent 写实人像 多模态大模型 EvoLink灵感 AI绘画 字节跳动 时尚大片 杂志排版 开源工具 开源模型 产品设计 商业海报 皮克斯风格 3D动画 色彩分析 AI生图 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 MoE架构 多模态AI
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.