FaceSwap – 开源的在线AI换脸工具,深度伪造视频和图像
FaceSwap是什么 FaceSwap 是一个开源的AI换脸软件,用于创建深度伪造(Deepfakes)视频和图像。基于深度学习技术,在视频或图片中将一个人的脸替换成另…
InstantStyle – 开源的个性化文本到图像生成框架,保留风格一致性
InstantStyle是什么 InstantStyle是小红书的InstantX团队(该团队也是InstantID框架背后的开发团队)开源的保留风格一致性的个性化文本到…
MotionGen – 元象科技推出的3D动作生成模型
MotionGen是什么 MotionGen是元象科技推出的3D动作生成模型,结合了大模型、物理仿真和强化学习算法,支持用户仅通过简单文本指令即可快速生成逼真且流畅的3D…
Pyramid-Flow – 北大、快手、北邮联合开源的AI视频生成模型
Pyramid-Flow是什么 Pyramid-Flow是一种先进的视频生成模型,由北京大学、快手科技和北京邮电大学的研究人员联合推出。模型根据文本提示生成长达10秒、分…
Mini-Omni – 开源的端到端实时语音对话大模型
Mini-Omni是什么 Mini-Omni 是一个开源的端到端语音对话模型,具备实时语音输入和输出的能力,能在对话中实现“边思考边说话”的功能。模型的设计支持在不需要额…
EchoMimic – 阿里推出的开源数字人项目,赋予静态图像以生动语音和表情
EchoMimic是什么 EchoMimic是阿里蚂蚁集团推出的AI数字人开源项目,赋予静态图像以生动语音和表情。通过深度学习模型结合音频和面部标志点,创造出高度逼真的动…
OpenAI人才流动:前研究员田永龙入职腾讯,深耕视觉语言模型研发
人工智能领域的人才流动近期引发关注。据最新消息,OpenAI前研究员田永龙(Yonglong Tian)已正式加盟腾讯,未来将进入腾讯大语言模型部工作,主要参与视觉语言模…
豆包PixelDance – 字节跳动推出的AI视频生成大模型,基于DiT结构
豆包PixelDance是什么 豆包PixelDance是字节跳动最新推出的AI视频生成模型,采用DiT结构,支持文生视频和图生视频。它能理解复杂指令,生成长达10秒的连…
Cloudflare联手OpenAI,AI搜索技术迎来新突破
7月8日,云服务提供商Cloudflare与OpenAI正式宣布启动一项深度的研究试点项目。双方此次合作的核心目标,是探索如何通过Cloudflare庞大的全球网络数据,…
ElevenLabs Flash – ElevenLabs推出的低延迟语音合成模型
ElevenLabs Flash是什么 ElevenLabs Flash是ElevenLabs推出的低延迟语音合成模型,专为快速对话型AI设计。ElevenLabs Fl…
壹视频大模型 – 新壹科技推出的AI视频创作大模型
新壹视频大模型是什么 新壹视频大模型是新壹科技推出的AI视频创作大模型,自研AI算法和深度学习技术,实现从剧本到成品的一键式创作。具备剧本生成、情感化语音合成、3D元素创…
OLMoE – 完全开源的大语言模型,基于混合专家(MoE)架构
OLMoE是什么 OLMoE(Open Mixture-of-Experts Language Models)是一个完全开源的大型语言模型,基于混合专家(MoE)架构。O…
Seed-Music – 字节跳动推出的AI音乐生成大模型
Seed-Music是什么 Seed-Music是字节跳动推出的AI音乐生成大模型,将用户录制的 10 秒音频转化为完整的音乐作品。通过自回归语言模型和扩散方法,根据用户…
AI创作新高度:字节跳动发布Seedream 5.0 Pro,开启交互式精准编辑时代
今天,字节跳动正式发布了多模态图像创作模型——Seedream5.0Pro,标志着AI图像创作从单纯的“生成”向更深层的“设计”迈进。相比前代版本,Seedream5.0…
Anthropic 抢先冲击 IPO,AI 行业迎来千亿营收新格局
全球 AI 行业再度迎来关键节点。最新市场分析指出,人工智能初创公司 Anthropic 已于今年6月1日秘密提交了首次公开募股(IPO)申请。若该流程推进顺利,Anth…
DesignEdit – 微软等开源的AI图像分层处理编辑框架
DesignEdit是什么 DesignEdit是由来自微软亚洲研究院和北京大学的研究人员共同开发的一个AI图像编辑框架,引入了设计领域的图层概念,采用多层潜在分解和融合…
