Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: InstructMove – 东京大学联合 Adobe 推出基于指令的图像编辑模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > InstructMove – 东京大学联合 Adobe 推出基于指令的图像编辑模型
AIGC 资讯

InstructMove – 东京大学联合 Adobe 推出基于指令的图像编辑模型

站外新闻
最近更新: 2026年6月9日 下午2:37
SHARE

InstructMove是什么

InstructMove是东京大学和Adobe公司联合推出的基于指令的图像编辑模型,通过观察视频中的帧对变化学习如何根据指令进行图像操作。模型基于多模态大型语言模型(MLLMs)生成描述帧对之间变化的编辑指令,训练出能在保持内容一致性的同时,执行复杂非刚性编辑任务的能力,如调整主体姿势、改变表情和视角等。InstructMove用真实视频帧作为数据源,确保编辑过程中内容的自然性和真实性,克服合成数据集在复杂编辑任务上的局限性。InstructMove支持基于掩码等控制机制进行精确的局部编辑,进一步增强在实际应用中的灵活性和实用性。

阅读目录
  • InstructMove是什么
  • InstructMove的主要功能
  • InstructMove的技术原理
  • InstructMove的项目地址
  • InstructMove的应用场景

InstructMove

InstructMove的主要功能

  • 非刚性编辑:能调整图像中主体的姿势、表情等非刚性特征,符合给定的编辑指令。
  • 视角调整:根据指令改变图像的拍摄视角,如将相机视角向左或向右移动等,改变图像的构图和视觉效果。
  • 元素重新排列:对图像中的元素进行重新排列或移动,如将玩具的腿放在一起、让鸟的尾巴可见等,满足特定的编辑需求。
  • 精确局部编辑:与掩码等控制机制的结合,支持对图像的特定区域进行精确的局部编辑,实现更细致的修改效果。

InstructMove的技术原理

  • 数据集构建
    • 视频帧采样:从互联网视频中采样帧对,确保帧对之间存在有意义的变换,如主体姿势变化、元素移动或相机视角调整等,获取到大量自然且真实的图像变换样本。
    • 多模态语言模型生成指令:用多模态大型语言模型(MLLMs),如GPT-4o或Pixtral-12B,分析采样得到的帧对之间的差异,生成准确的编辑指令。
  • 模型架构与训练
    • 预训练模型微调:在构建的数据集上微调预训练的文本到图像(T2I)模型,如Stable Diffusion。
    • 空间条件策略:引入空间条件策略,将参考图像与噪声输入沿空间维度进行拼接,而不是传统的通道拼接。
    • 去噪网络训练:将拼接后的输入送入去噪U-Net网络,预测噪声图。给予计算预测噪声图与原始噪声图之间的差异,优化模型参数,准确地根据编辑指令对目标图像进行去噪和重建,实现图像编辑。
  • 控制机制集成
    • 掩码引导:支持与掩码等控制机制的集成,实现精确的局部编辑。在推理阶段,用掩码控制编辑区域,将更新后的潜在表示与参考潜在表示进行融合,对图像的特定部分进行修改。
    • 其他空间控制:与ControlNet等可控扩散模型集成,接受用户提供的额外视觉线索,如草图或骨架关键点等,实现更复杂和精确的图像编辑操作。

InstructMove的项目地址

  • 项目官网:ljzycmd.github.io/projects/InstructMove
  • arXiv技术论文:https://arxiv.org/pdf/2412.12087v1

InstructMove的应用场景

  • 影视后期制作:特效师调整科幻电影中外星生物角色的表情,让其更符合剧情要求的愤怒情绪。
  • 广告创意设计:设计师用为汽车广告调整赛车视角和背景元素,突出新车型的速度与激情特点,吸引消费者注意。
  • 室内设计:室内设计师调整卧室床头柜位置和窗帘样式,满足客户对美观和实用性的需求,营造温馨舒适的睡眠环境。
  • 艺术教育:老师在绘画课上调整人物动作,帮助学生理解动作与情感的关系,加深对艺术创作的理解。
  • 个人照片编辑:个人用户调整聚会照片中的表情,使其更自然轻松,分享到社交平台,获得朋友点赞好评。
MOCR:3B参数开源文档解析模型,图形重建能力超越Gemini 3 Pro
Casevo – 中国传媒大学推出的开源社会传播模拟系统
AutoAgents – AI Agent 生成框架,自然语言创建和部署LLM智能体
RAG Logger – 专为检索增强生成应用设计的开源日志工具
R1-Omni – 阿里通义开源的全模态大语言模型
分享
Email 复制链接 打印
Share
上一篇 GPT‑5.3‑Codex‑Spark – OpenAI推出的轻量级编程模型
下一篇 SoulChat2.0 – 华南理工大学推出的心理咨询师数字孪生大语言模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

阶跃星辰发布Step-Audio-R1.1:全球首个开源原生语音推理模型,以96.4%准确率登顶权威榜单
AI 工具 AIGC 资讯
谷歌重磅开源 TranslateGemma:Gemma 3 系列翻译模型,支持 55 种语言与多模态图像翻译
AI 工具 AIGC 资讯
FLUX.2 [klein] 开源:Black Forest Labs 推出亚秒级图像生成模型,4B版仅需13GB显存
AI 工具 AIGC 资讯
OpenWork:开源AI桌面工作流平台,打造高效自动化办公新体验
AI 工具 最新趋势

相关推荐

AIGC 资讯

DeepSeek Artifacts – Hugging Face推出的AI编程工具,基于DeepSeek V3

站外新闻
AIGC 资讯

MiniMax-01 – MiniMax开源的全新系列模型

站外新闻
AIGC 资讯

CopilotKit – 开源 AI Agent 开放框架,全栈 Agent UI 基础设施

站外新闻
AI 工具AIGC 资讯

商汤SenseNova 6.7 Flash-Lite发布:Token消耗直降60%的多模态智能体,开箱即用领办公自动化

站外新闻
SenseNova 办公自动化 商汤科技 多模态智能体 轻量化模型
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

Agent AI AI Agent AIGC AI大模型 AI安全 AI工具 AI搜索 AI智能体 AI绘画 AI编程 AI视频 AI视频生成 AI设计 AI音乐生成 Anthropic chatgpt Claude Claude Code Claude Mythos Claude Opus 4.8 DeepSeek DuckDuckGo Gemini GPT-5.5 MCP协议 Midjourney MiniMax Mistral AI MoE架构 NVIDIA openai OpenClaw OpenRouter prompt SWE-Bench xAI 世界模型 丛林 人工智能 人物 企业级AI 具身智能 命令行工具 图像生成模型 多智能体 多模态 多模态AI 多模态大模型 大模型 大模型API 大模型应用 大模型推理 大语言模型 字节跳动 家居 小米 小红书 展台 开源 开源AI工具 开源大模型 开源工具 开源框架 开源模型 开源项目 强化学习 微软 教程 早报 昆仑万维 智能体编程 智谱AI 月之暗面 本地AI 海报设计 清华大学 生成式AI 科大讯飞 科幻 端侧AI 端侧大模型 端侧部署 网络安全 腾讯 腾讯混元 英伟达 视频生成 视频生成模型 语音合成 谷歌 谷歌AI 赛博朋克 边缘计算 通义千问 长上下文 阶跃星辰 阿里通义 面壁智能 香港大学
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.