Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: AnyText – 阿里开源的视觉图像文字生成和编辑模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > AnyText – 阿里开源的视觉图像文字生成和编辑模型
AIGC 资讯

AnyText – 阿里开源的视觉图像文字生成和编辑模型

站外新闻
最近更新: 2026年7月10日 上午12:31
SHARE

AnyText是什么

AnyText是阿里巴巴智能计算研究院的团队推出的一个基于扩散的多语言视觉文本生成和编辑模型,专注于在图像中渲染准确和连贯的文本。AnyText包括两个主要元素的扩散管线:辅助潜在模块和文本嵌入模块。前者使用文本字形、位置和蒙版图像等输入来生成文本生成或编辑的潜在特征。后者采用OCR模型对笔划数据进行编码,这些编码与来自分词器的图像标题嵌入结合,生成与背景无缝融合的文本。该技术解决了在生成图像中的文本区域时合成文本模糊、不可读或错误的挑战,提高了图像中文本书写的准确性。

阅读目录
  • AnyText是什么
  • AnyText的功能特色
  • AnyText的工作原理
  • 如何使用AnyText生成文字

AnyText模型

GitHub项目:https://github.com/tyxsspa/AnyText

论文地址:https://arxiv.org/abs/2311.03054

ModelScope:https://modelscope.cn/studios/damo/studio_anytext

Hugging Face:https://huggingface.co/spaces/modelscope/AnyText

AnyText的功能特色

  • 多语言支持:AnyText能够生成多种语言的文本,包括中文、英文、日文、韩文等。
  • 多行文本生成:用户可以指定在图像的多个位置生成文本。
  • 变形区域书写:AnyText能够生成水平、垂直甚至曲线或不规则区域内的文本。
  • 文本编辑能力:AnyText提供了修改图像中指定位置文本内容的功能,同时保持与周围文本风格的一致性。
  • 即插即用:AnyText可以无缝集成到现有的扩散模型中,提供生成文本的能力。

AnyText

AnyText的工作原理

AnyText的工作原理

AnyText通过以下模块的协同工作,AnyText能够在图像中准确地生成和编辑多语言文本,同时保持与背景的无缝融合,具体如下:

  1. 文本控制扩散管道:
    • AnyText使用变分自编码器(VAE)对输入图像进行编码,生成一个潜在表示。
    • 然后,通过扩散算法逐步向这个潜在表示中添加噪声,生成一系列时间步骤的噪声潜在图像。
    • 在每个时间步骤,AnyText应用一个网络(TextControlNet)来预测应该添加到噪声潜在图像上的噪声,以控制文本的生成。
  2. 辅助潜在模块:
    • 该模块接收文本字形(glyph)、位置(position)和蒙版图像(masked image)作为输入,生成一个辅助潜在特征图。
    • 字形信息通过渲染文本到图像上生成,位置信息标记文本在图像中的位置,掩膜图像指示在扩散过程中应保留的图像区域。
  3. 文本嵌入模块:
    • 该模块使用预训练的OCR模型(如PP-OCRv3)来提取文本的笔画信息,并将其编码为嵌入。
    • 这些嵌入与来自分词器的图像标题嵌入结合,生成一个融合的中间表示,然后通过交叉注意力机制映射到UNet的中间层。
  4. 文本感知损失:
    • 在训练过程中,AnyText使用文本感知损失来进一步提高文本生成的准确性。
    • 这种损失通过比较生成图像和原始图像中的文本区域来实现,只关注文本本身的正确性,排除背景、字符位置偏差、颜色或字体样式等因素。
  5. 训练和优化:
    • AnyText的训练目标是最小化文本控制扩散损失和文本感知损失的加权和。
    • 在训练过程中,模型通过调整权重比(λ)来平衡这两种损失。

如何使用AnyText生成文字

  1. 访问AnyText的ModelScope空间或Hugging Face demo
  2. 输入Prompt提示词,然后选择指定文字位置
  3. 最后点击Run运行,等待图片和文字生成即可
Ultravox – 端到端多模态大模型,直接理解文本和人类语音
DCLM-7B – 苹果公司与合作团队推出的开源小模型
Meta AI 聊天机器人订阅服务正式上线:月费低至7.99美元,高级版仅19.99美元,引领AI消费商业化浪潮
UnifoLM-OminiA-0.3 – 宇树科技推出的全模态交互理解模型
首token延迟砍掉3. 25 倍:小红书联手北大、上交提出HYPIC,给混合注意力大模型装上”位置无关缓存”
分享
Email 复制链接 打印
Share
上一篇 Bocha Semantic Reranker – 博查推出的语义排序模型
下一篇 PuLID – 字节跳动开源的个性化文本到图像生成框架
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

GPT-Rosalind – OpenAI 推出的生命科学专用推理模型
AIGC 资讯
Kimi K2.6 – 月之暗面开源的最新旗舰模型
AIGC 资讯
Sage – 商汤绝影推出的端侧多模态智能体基座大模型
AIGC 资讯
MiMo-V2.5 – 小米推出的全模态 Agent 大模型系列
AIGC 资讯

相关推荐

AIGC 资讯

Bolt3D – 牛津大学联合谷歌推出的 3D 场景生成技术

站外新闻
AIGC 资讯

Mochi 1 – Genmo推出的开源高质量AI视频生成模型

站外新闻
AIGC 资讯

TabFM – 谷歌开源的零样本表格基础模型

站外新闻
AIGC 资讯

EmaFusion – AI初创公司 Ema 推出的多模型融合技术

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.