FLUX1.1 – Black Forest Labs团队推出的超写实AI图像生成模型,代号“蓝莓”
FLUX1.1是什么 FLUX1.1 Pro是Black Forest Labs团队最新推出的升级版AI图像生成模型,代号“蓝莓”,提供比前代快6倍的生成速度,同时保持了…
Filmfotos – 模拟和还原胶片质感效果的LoRA模型
Filmfotos是什么 Filmfotos是由DynamicWang推出的的基于Flux架构的LoRA模型,专注于模拟和还原胶片的质感效果。以低饱和度的日系胶片风格为特…
VFusion3D – Meta联合牛津大学推出的AI生成3D模型项目
VFusion3D是什么 VFusion3D 是由 Meta 和牛津大学的研究人员共同推出的AI生成3D模型项目,能从单张图片或文本描述中生成高质量的3D对象。VFusi…
MM1.5 – 苹果推出的升级版多模态大模型
MM1.5是什么 MM1.5是苹果公司推出的多模态大型语言模型,旨在增强文本丰富图像理解、视觉指代和定位以及多图像推理能力。模型基于数据为中心的训练方法,在大规模预训练、…
RegionDrag – 港大和牛津联合开发的基于区域的图像编辑技术
RegionDrag是什么 RegionDrag是由香港大学和牛津大学联合开发的一种基于区域的图像编辑技术。基于扩散模型,让用户定义手柄区域和目标区域来表达编辑意图,实现…
LivePortrait – 快手推出的开源人像动画生成框架
LivePortrait是什么 LivePortrait是快手推出的开源人像动画生成框架,专注于高效、可控地将驱动视频的表情和姿态迁移至静态或动态人像,创造出富有表现力的…
美图奇想大模型 – 美图公司推出的AI视觉大模型
美图奇想大模型是什么 美图奇想大模型(MiracleVision)是美图公司推出的一款AI视觉大模型,专注于美学创作,包括东方美学、人像和商业设计等。模型完成了视频生成能…
MetaMorph – 统一多模态理解与生成大模型,基于VPiT 预测多模态 token
MetaMorph是什么 MetaMorph是多模态大模型(MLLM),通过指令微调(Instruction Tuning)实现视觉理解和生成。它提出了一种名为Visua…
Wav2Lip – 开源的唇形同步工具
Wav2Lip是什么 Wav2Lip是开源的唇形同步工具,支持用户将音频文件转换成与口型同步的视频,广泛应用于视频编辑和游戏开发等领域。Wav2Lip不仅能够实现实时口型…
Realtime API – OpenAI推出的实时语音交互API
Realtime API是什么 Realtime API是OpenAI推出的一种低延迟、多模态的对话式API,支持文本和音频作为输入和输出。Realtime API允许开…
Faster Whisper – 一款高效语音识别工具,实现高速转写和快速推理
Faster Whisper是什么 Faster Whisper 是一个基于OpenAI Whisper模型的高效语音识别工具,运用CTranslate2引擎实现快速推理…
edge-tts – 开源的AI文字转语音项目
edge-tts是什么 edge-tts是开源的AI文字转语音项目,支持超过40种语言和300多种声音。edge-tts利用微软Azure Cognitive Servi…
Surya – 开源的OCR工具包,支持90+语言、布局分析等识别
Surya是什么 Surya是一款功能强大的开源OCR(光学字符识别)工具包,专门设计用在文档识别,支持超过90种语言的识别。Surya能准确识别出文档中的文本,分析文本…
LinFusion – 新加坡国立推出图像生成模型,单GPU一分钟生成16K图像
LinFusion是什么 LinFusion 是新加坡国立大学研究团队开发的一种创新图像生成模型,基于线性注意力机制来处理高分辨率图像生成任务。使模型在处理大量像素时的计…
SafeEar – 浙大和清华联合开源的AI音频伪造检测框架
SafeEar是什么 SafeEar是由浙江大学和清华大学联合开发的AI音频伪造检测框架,保护用户隐私的同时检测音频伪造。采用基于神经音频编解码器的解耦模型,分离语音的声…
AgentScope – 阿里开源的多智能体开发平台
AgentScope是什么 AgentScope是阿里巴巴集团开源的多智能体开发平台,帮助开发者轻松构建和部署多智能体应用。AgentScope提供高易用性、高鲁棒性和分…
