Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: PixelHacker – 华中科技联合VIVO推出的图像修复模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > PixelHacker – 华中科技联合VIVO推出的图像修复模型
AIGC 资讯

PixelHacker – 华中科技联合VIVO推出的图像修复模型

站外新闻
最近更新: 2026年6月7日 下午9:59
SHARE

PixelHacker是什么

PixelHacker 是华中科技大学和 VIVO AI Lab联合推出的图像修复(Image Inpainting)模型。基于引入潜在类别引导(Latent Categories Guidance, LCG)范式,分别对前景和背景进行编码,基于线性注意力将特征注入去噪过程中,实现结构和语义的一致性。模型基于大规模数据集(包含 1400 万图像 – 掩码对)进行预训练,在多个开源基准数据集(如 Places2、CelebA-HQ 和 FFHQ)上微调,展现出卓越的修复效果。

阅读目录
  • PixelHacker是什么
  • PixelHacker的主要功能
  • PixelHacker的技术原理
  • PixelHacker的项目地址
  • PixelHacker的应用场景
PixelHacker

PixelHacker的主要功能

  • 高质量图像修复:在自然场景、人脸图像等多种数据集上表现出色,生成逼真的修复内容。
  • 结构和语义一致性:确保修复区域与周围环境在纹理、形状和颜色上自然过渡,逻辑上符合场景。
  • 适应多种场景:对不同类型的图像(如风景、人脸、复杂背景)具有良好的适应性,支持多种分辨率和掩码类型。

PixelHacker的技术原理

  • 潜在类别引导(LCG):将图像分为前景和背景两部分,分别用在两个固定大小的嵌入(embeddings)编码潜在特征。方法避免对具体类别标签的依赖。在训练时,用多种掩码(如随机笔刷掩码、对象语义掩码、场景语义掩码等)构造图像-掩码对,分配到前景或背景嵌入中。
  • 扩散模型架构:基于扩散模型(Diffusion Model)作为其生成框架。扩散模型基于逐步去噪的过程生成图像内容,生成高质量且多样化的图像。在去噪过程中,基于线性注意力(Linear Attention)将前景和背景的潜在特征注入到模型中。
  • 训练和微调:在包含 1400 万图像掩码对的大规模数据集上进行预训练,学习到丰富的图像分布和语义信息。在预训练的基础上,PixelHacker 在多个开源基准数据集(如 Places2、CelebA-HQ 和 FFHQ)上进行微调,适应特定任务和数据分布,进一步提升性能。
  • 多步交互:在去噪的每一步中,基于线性注意力将前景和背景的潜在特征与当前的图像特征进行交互,确保生成内容在结构和语义上与周围环境保持一致。
  • 分类器自由引导(CFG):在推理阶段,用分类器自由引导(Classifier-Free Guidance)技术,调整引导规模(guidance scale)平衡生成内容的多样性和一致性。

PixelHacker的项目地址

  • 项目官网:https://hustvl.github.io/PixelHacker/
  • GitHub仓库:https://github.com/hustvl/PixelHacker
  • arXiv技术论文:https://arxiv.org/pdf/2504.20438

PixelHacker的应用场景

  • 修复老旧照片:自动填补划痕、污渍或缺失部分,恢复照片完整性。
  • 移除无关对象:从图像中去除不需要的元素(如行人、杂物),保持背景自然。
  • 创意内容生成:辅助艺术家和设计师快速生成高质量图像,用于广告、海报或艺术创作。
  • 医学影像修复:填补医学图像中的缺失或损坏区域,提升诊断准确性。
  • 文化遗产保护:修复文物和古籍图像,填补缺失部分,助力文化传承。
Decart AI开源Lucy Edit Dev:一句话指令即可编辑视频,保留原生运动与构图的革命性AI模型
Mistral Small 3.1 – Mistral AI 开源的多模态 AI 模型
Granite 3.2 – IBM 开源的多模态系列 AI 模型
OmniGen2开源多模态生成模型:文本生图、图像编辑全能,智源研究院引领AIGC新范式
GPT‑5.3‑Codex‑Spark – OpenAI推出的轻量级编程模型
分享
Email 复制链接 打印
Share
上一篇 KeySync – 帝国理工联合弗罗茨瓦夫大学推出的口型同步框架
下一篇 PilotDeck – 清华联合面壁智能开源的 Agent 操作系统
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

快手OneRec:颠覆传统推荐!端到端生成式AI系统引爆观看时长与GMV
AI 工具 AIGC 资讯
Kimi-Researcher:月之暗面端到端强化学习Agent,深度研究基准测试超Claude 4 Opus
AI 工具 AIGC 资讯
华为盘古大模型5.5震撼发布:7180亿参数Ultra MoE领衔,五大模型重塑产业智能
AI 工具 AIGC 资讯
腾讯清华重磅开源MindOmni:强化学习驱动的多模态推理生成模型,重塑视觉AI边界
AI 工具 AIGC 资讯

相关推荐

量子芯片科技感占位特色图
AI 工具AIGC 资讯

育碧《孤岛惊魂7》秘密测试生成式AI遭曝光!曝料人称效果“烂透了”,押注NPC智能交互能否翻盘?

站外新闻
AI游戏开发 NPC智能交互 孤岛惊魂7 生成式AI 育碧
全息流体渐变通用占位特色图
AIGC 资讯

西班牙AI立法重磅落地:违规最高罚3500万欧元,欧洲监管铁幕再升级

站外新闻
AI监管 人工智能专员 人工智能法案 欧盟AI法案 西班牙
AI 工具AIGC 资讯

腾讯HunyuanVideo 1.5开源:8.3B参数模型,14G显存流畅生成高清视频

站外新闻
AIGC HunyuanVideo 开源大模型 腾讯混元 视频生成模型
AI 工具AIGC 资讯

微软重磅发布MAI-Transcribe-1语音转文字模型:25种语言全面超越Whisper,成本直降50%,企业级应用场景全解析

站外新闻
FLEURS基准测试 企业级AI模型 多语言识别 微软Azure AI 语音转文字
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

Agent AI AI Agent AIGC AI大模型 AI安全 AI工具 AI智能体 AI绘画 AI编程 AI编程助手 AI编程工具 AI编程模型 AI视频生成 AI音乐生成 Anthropic chatgpt Claude Claude Code DeepSeek Gemini GPT-5.3 Instant GPT-5.3-Codex-Spark GPT-5.4 MCP协议 meta Midjourney MiniMax MoE架构 MoE模型 openai prompt Qwen3 RAG SWE-Bench xAI 上海人工智能实验室 世界模型 人工智能 人物 代码生成 企业级AI 全模态大模型 具身智能 命令行工具 图像生成 图像生成模型 多智能体 多模态 多模态AI 多模态大模型 多模态模型 大模型 大模型应用 大语言模型 字节跳动 小红书 展台 开源 开源AI 开源AI工具 开源大模型 开源工具 开源平台 开源框架 开源模型 开源项目 强化学习 微软 扩散模型 教程 数字人 文本转语音 早报 昆仑万维 智谱AI 月之暗面 清华大学 知识管理 科大讯飞 端侧AI 美团 腾讯 腾讯混元 自然语言处理 英伟达 蚂蚁集团 视觉语言模型 视频生成 视频生成模型 语音合成 谷歌 谷歌AI 谷歌DeepMind 通义千问 阶跃星辰 阿里巴巴 阿里通义 面壁智能 香港大学
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.