Meta Motivo – Meta 推出控制数字智能体动作的人工智能模型
Meta Motivo是什么 Meta Motivo 是 Meta 公司推出的AI模型,能提升元宇宙体验的真实性。Meta Motivo基于控制虚拟人形智能体的全身动作,…
YOLOv9 – 新一代高效的实时目标检测系统
YOLOv9是什么 YOLOv9是一个由台北中研院和台北科技大学等机构的研究团队推出的新一代先进的目标检测系统,是YOLO(You Only Look Once)算法系列…
Step-1o Audio – 阶跃星辰推出的国内首个千亿参数端到端语音大模型
Step-1o Audio是什么 Step-1o Audio是阶跃星辰推出的国内首个千亿参数端到端语音大模型。具备强大的情绪感知能力,能精准识别用户语气中的情感,结合语境…
VideoPrism – 谷歌研究团队推出的通用视频编码器
VideoPrism是什么 VideoPrism是一个由谷歌研究团队开发的通用视频编码器,旨在通过一个单一的预训练模型来处理多种视频理解任务。该模型能够从视频中提取丰富的…
360gpt2-o1 – 360 推出国产自研 AI 大模型,多项评测优于GPT-4o
360gpt2-o1是什么 360gpt2-o1是 360 自研的 AI 大模型,在推理能力上有显著提升,特别是在数学和逻辑推理任务上表现出色。模型通过合成数据优化、模型…
GPT-SoVITS – 开源的声音克隆项目,只需少量数据即可合成声音
GPT-SoVITS是什么 GPT-SoVITS是一个开源的声音克隆项目,由B站UP主、RVC变声器创始人花儿不哭推出,该语音合成工具结合了GPT(Generative …
POINTS 1.5 – 腾讯微信推出的多模态大模型
POINTS 1.5是什么 POINTS 1.5 是腾讯微信发布的多模态大模型,是POINTS 1.0的升级版本。 模型继续沿用了POINTS 1.0中的LLaVA架构,…
OpenCodeInterpreter – 开源的代码解释器,可生成和执行代码
OpenCodeInterpreter是什么 OpenCodeInterpreter是一个开源的代码解释器系统,旨在通过利用大模型结合代码生成、执行和迭代精炼的能力,可以…
Llama 3 – Meta开源推出的新一代大语言模型
Llama 3是什么 Llama 3是Meta公司最新开源推出的新一代大型语言模型(LLM),包含8B和70B两种参数规模的模型,标志着开源人工智能领域的又一重大进步。作…
k1 视觉思考模型 – kimi推出的 k1 系列强化学习模型
k1 视觉思考模型是什么 k1 视觉思考模型是kimi推出的k1系列强化学习AI模型,原生支持端到端图像理解和思维链技术,将能力扩展到数学之外的更多基础科学领域。k1模型…
ChatMusician – 可理解和生成音乐的大模型
ChatMusician是什么 ChatMusician是由Multimodal Art Projection Research Community、Skywork AI…
FunClip – 阿里达摩院开源的AI自动视频剪辑工具
# 1. 克隆GitHub源代码 git clone https://github.com/alibaba-damo-academy/FunClip.git # 2. 安…
FreeScale – 无需微调的推理框架,提升扩散模型生成能力首次实现8K分辨率图像
FreeScale是什么 FreeScale是南洋理工大学、阿里巴巴集团和复旦大学推出无需微调的推理框架,提升预训练扩散模型生成高分辨率图像和视频的能力。FreeScal…
EMO – 阿里推出的AI肖像视频生成框架
EMO是什么 EMO(Emote Portrait Alive)是一个由阿里巴巴集团智能计算研究院的研究人员开发的框架,一个音频驱动的AI肖像视频生成系统,能够通过输入单…
Phi-3 – 微软最新推出的新一代小模型系列
Phi-3是什么 Phi-3是微软研究院推出的新一代系列先进的小语言模型,包括phi-3-mini、phi-3-small和phi-3-medium三个不同规模的版本。这…
Animate Anyone – 阿里推出的图像到视频角色动画合成的框架
Animate Anyone是由阿里巴巴智能计算研究院推出的一款将静态图像中的角色或人物进行动态化的开源框架,已在GitHub上斩获了近1.3万个星标,并在国内外引起了热…
