Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Qihoo-T2X – 360 AI 研究院和中山大学开源的高效多模态生成模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Qihoo-T2X – 360 AI 研究院和中山大学开源的高效多模态生成模型
AIGC 资讯

Qihoo-T2X – 360 AI 研究院和中山大学开源的高效多模态生成模型

站外新闻
最近更新: 2026年6月8日 上午11:33
SHARE

QIHOO-T2X是什么

Qihoo-T2X 是360 AI 研究院和中山大学推出的基于代理标记化扩散 Transformer(PT-DiT)的高效多模态生成模型,Qihoo-T2X引入稀疏代理标记注意力机制,显著降低传统扩散 Transformer 在全局自注意力计算中的冗余性,结合窗口注意力和移位窗口注意力增强细节建模能力。Qihoo-T2X 支持多种任务,包括文本到图像(T2I)、文本到视频(T2V)和文本到多视图(T2MV)生成。

阅读目录
  • QIHOO-T2X是什么
  • Qihoo-T2X的主要功能
  • Qihoo-T2X的技术原理
  • Qihoo-T2X的项目地址
  • Qihoo-T2X的应用场景

QIHOO-T2X

Qihoo-T2X的主要功能

  • 文本到图像:根据输入的文本描述生成高质量、高分辨率的图像,生成与文本描述高度一致的图像内容,适用于创意设计、艺术生成等领域。
  • 文本到视频:根据文本描述生成连贯的视频内容,支持生成动态场景和视频序列,适用于视频创作、动画制作等场景。
  • 文本到多视图:根据文本描述生成同一物体或场景的多视角图像,适用于 3D 对象的多视角展示,支持虚拟现实(VR)和增强现实(AR)应用。
  • 高效生成:基于优化的代理标记化注意力机制,显著降低计算复杂度,支持高分辨率图像和长视频的高效生成,降低训练和推理成本。

Qihoo-T2X的技术原理

  • 代理标记化注意力:传统的扩散 Transformer 用全局自注意力机制,计算复杂度高且存在冗余。PT-DiT(Qihoo-T2X的核心架构) 基于在每个时空窗口内计算平均标记作为代理标记(proxy tokens),对代理标记进行自注意力计算,大幅减少计算量。代理标记之间的全局语义信息基于交叉注意力(cross-attention)注入到所有潜在标记中,确保全局信息的有效传播。
  • 窗口注意力与移位窗口注意力:为增强局部细节建模能力,PT-DiT 引入窗口注意力机制,对局部窗口内的标记进行自注意力计算。移位窗口注意力机制用在避免因窗口划分导致的“网格效应”,进一步提升生成质量。
  • 稀疏代理标记的高效计算:基于稀疏代理标记机制,PT-DiT 在处理高分辨率图像和长视频时,显著降低计算复杂度,且保持生成内容的质量。
  • 多任务适应性:PT-DiT 的架构设计能无缝适应图像生成、视频生成和多视图生成等多种任务,无需对模型结构进行重大调整。

Qihoo-T2X的项目地址

  • 项目官网:https://360cvgroup.github.io/Qihoo-T2X/
  • GitHub仓库:https://github.com/360CVGroup/Qihoo-T2X
  • arXiv技术论文:https://arxiv.org/pdf/2409.04005

Qihoo-T2X的应用场景

  • 创意设计与艺术创作:基于文本描述快速生成高质量艺术图像,支持多种风格,加速设计流程,为艺术家提供灵感。
  • 视频内容生成:生成连贯的动画视频,适用于广告、宣传和动画制作,减少视频创作成本和时间。
  • 教育与培训:生成教学用图像和视频,帮助学生理解复杂概念,支持虚拟实验室和动态教学资源。
  • 娱乐与游戏开发:生成虚拟场景、角色和动态内容,用在游戏开发、虚拟现实(VR)和增强现实(AR)应用,提升沉浸感。
  • 广告与营销:快速生成个性化广告图像和视频,提高营销效果,满足品牌视觉内容需求。
Step-Audio-AQAA:突破ASR/TTS瓶颈!StepFun推出端到端音频语言模型,重塑人机语音交互
蚂蚁集团Ming-omni-tts重磅开源:16.8B参数统一音频生成大模型,粤语情感控制超93%,超越SeedTTS引领AIGC音频新范式
小米MiMo-V2.5发布:1T参数全模态Agent,千轮调用+1M上下文,开源在即
GRUtopia 2.0 – 上海 AI Lab 推出的通用具身智能仿真平台
卢宗青团队重磅开源Being-H0.5:通用机器人模型突破,实现跨形态策略迁移与真实部署
分享
Email 复制链接 打印
Share
上一篇 GigaTok – 港大联合字节推出用于自回归图像生成的视觉分词器
下一篇 Baichuan-Audio – 百川智能开源的端到端语音交互模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

Self Forcing: Adobe与德克萨斯大学联合推出实时视频生成模型,单GPU实现17FPS,告别传统AI视频生成延迟
AI 工具 AIGC 资讯
腾讯AI Lab重磅开源SongGeneration:AI音乐生成大模型,多轨合成、风格克隆,媲美商业模型
AI 工具 AIGC 资讯
快手OneRec:颠覆传统推荐!端到端生成式AI系统引爆观看时长与GMV
AI 工具 AIGC 资讯
Kimi-Researcher:月之暗面端到端强化学习Agent,深度研究基准测试超Claude 4 Opus
AI 工具 AIGC 资讯

相关推荐

AI 工具AIGC 资讯

Oh My OpenCode:AI编程助手革命性插件,自动调度多模型Agent团队,一键提升开发效率

站外新闻
Agent调度 AI编程助手 多模型协作 开发效率 开源插件
AIGC 资讯

MAI-Code-1-Flash – 微软推出的轻量级代码生成模型

站外新闻
AIGC 资讯

Liquid – 华中科技、字节、港大联合推出的统一多模态生成框架

站外新闻
AI 工具AIGC 资讯

阿里通义重磅开源Qwen3-VL-Reranker:跨模态检索精度飙升,多模态AI应用新引擎

站外新闻
Qwen3-VL-Reranker 信息检索 多模态大模型 跨模态检索 阿里通义
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

Agent AI AI Agent AIGC AI大模型 AI安全 AI工具 AI智能体 AI绘画 AI编程 AI编程助手 AI编程工具 AI编程模型 AI视频生成 AI音乐生成 Anthropic chatgpt Claude Claude Code DeepSeek Gemini GPT-5.3 Instant GPT-5.3-Codex-Spark GPT-5.4 MCP协议 meta Midjourney MiniMax MoE架构 MoE模型 openai prompt Qwen3 RAG SWE-Bench xAI 上海人工智能实验室 世界模型 人工智能 人物 代码生成 企业级AI 全模态大模型 具身智能 命令行工具 图像生成 图像生成模型 多智能体 多模态 多模态AI 多模态大模型 多模态模型 大模型 大模型应用 大语言模型 字节跳动 小红书 展台 开源 开源AI 开源AI工具 开源大模型 开源工具 开源平台 开源框架 开源模型 开源项目 强化学习 微软 扩散模型 教程 数字人 文本转语音 早报 昆仑万维 智谱AI 月之暗面 清华大学 知识管理 科大讯飞 端侧AI 美团 腾讯 腾讯混元 自然语言处理 英伟达 蚂蚁集团 视觉语言模型 视频生成 视频生成模型 语音合成 谷歌 谷歌AI 谷歌DeepMind 通义千问 阶跃星辰 阿里巴巴 阿里通义 面壁智能 香港大学
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.