Voice Engine – OpenAI公布的AI语音合成和声音克隆模型
Voice Engine是什么 Voice Engine是OpenAI最新公布的一项AI语音合成和声音克隆技术,能够利用简短的15秒音频样本和文本输入,生成接近原声的自然…
AIEditor – 面向AI的下一代富文本编辑器
AIEditor是什么 AIEditor是面向 AI 的下一代富文本编辑器,AIEditor基于Web Component开发,支持 Layui、Vue、React、An…
Reflection 70B – HyperWrite公司推出的开源AI大模型
Reflection 70B是什么 Reflection 70B是HyperWrite公司推出的开源AI大模型,以卓越的性能在多个基准测试中超越了GPT-4o和Llama…
MimicMotion – 腾讯推出的AI人像动态视频生成框架
MimicMotion是什么 MimicMotion是腾讯的研究人员推出的一个高质量的人类动作视频生成框架,利用置信度感知的姿态引导技术,确保视频帧的高质量和时间上的平滑…
Stable Diffusion 3 – Stability AI推出的新一代图像生成模型
Stable Diffusion 3是什么 Stable Diffusion 3 是由 Stability AI 开发的一款先进的文本到图像生成模型,是 Stable D…
OpenMusic – 基于 QA-MDT 的开源高质量文生音乐模型
OpenMusic是什么 OpenMusic 是一款基于 QA-MDT(Quality-aware Masked Diffusion Transformer)技术的高质量…
小米全新 AI 战略:构建未来的智能基础设施,重塑行业格局!
在智能科技日益发展的今天,小米公司正积极调整其战略布局,以适应 AI 大模型的崛起。小米最近宣布将小爱同学的技术团队进行重组,目的是将 AI 技术深度融入到公司各个业务中…
Explorer – AI 3D世界生成模型,文本图像秒变3D渲染场景
Explorer是什么 Explorer是Odyssey公司推出的生成性世界模型,能将任何图像转化为详细的3D世界。Explorer模型擅长生成真实感世界,支持动态效果的…
Phi-3.5 – 微软推出的新一代AI模型,mini、MoE混合和视觉模型
Phi-3.5是什么 Phi-3.5是微软推出的新一代AI模型系列,包含 Phi-3.5-mini-instruct、Phi-3.5-MoE-instruct 和 Phi…
OutofFocus – 文本驱动图像生成或编辑的AI工具
OutofFocus是什么 OutofFocus是一个基于AI技术的图像编辑工具,基于Gradio平台为用户提供一个直观的界面操作和编辑图片。工具的核心功能是接受用户的文…
AI Youtube Shorts Generator – 开源的AI视频编辑工具,自动分析视频提取精彩片段
AI Youtube Shorts Generator是什么 AI Youtube Shorts Generator 是一款开源的 AI 视频编辑工具,基于 GPT-4、…
SWE-agent – 普林斯顿开源的AI程序员智能体
SWE-agent是什么 SWE-agent是一个由普林斯顿大学NLP组研究人员开发的开源AI程序员和软件工程师系统,利用大型语言模型(如GPT-4)的能力,可以自动解决…
Omages – 开源的3D模型生成项目
Omages是什么 Omages是一个开源的3D模型生成项目,基于图像扩散技术将3D形状的几何和纹理信息编码进64×64像素的2D图像中,简化3D建模流程。不仅提高了3D…
Loopy – 字节跳动推出的音频驱动的AI视频生成模型
Loopy是什么 Loopy是字节跳动推出的音频驱动的AI视频生成模型,用户可以让一张静态照片动起来,照片中的人物根据给定的音频文件进行面部表情和头部动作的同步,生成逼真…
FreeAskInternet – 免费开源的本地AI搜索引擎
FreeAskInternet是什么 FreeAskInternet是一个免费开源的本地AI搜索引擎,整合了GPT-3.5等先进的大型语言模型(LLM)和SearXNG元…
ConsiStory – 免训练实现主题一致性的文生图方法
ConsiStory是什么 ConsiStory是由NVIDIA和特拉维夫大学的研究人员共同开发的一种无需训练的文本生成图像的方法,可以实现让图像在保持风格和主题不变的情…
