Qwen2-VL – 阿里巴巴达摩院开源的视觉多模态AI模型
Qwen2-VL是什么 Qwen2-VL是阿里巴巴达摩院开源的视觉多模态AI模型,具备高级图像和视频理解能力。Qwen2-VL支持多种语言,能处理不同分辨率和长宽比的图片…
F5-TTS – 上海交大推出开源的文本到语音(TTS)合成系统
F5-TTS是什么 F5-TTS是由上海交通大学开源的一款高性能文本到语音(TTS)系统,基于流匹配的非自回归生成方法,结合扩散变换器(DiT)技术。系统在没有额外监督的…
FluxMusic – 开源的AI音乐生成模型,通过文本描述创造音乐
FluxMusic是什么 FluxMusic 是一个开源的音乐生成模型,基于扩散模型和 Transformer 架构将文本描述转换成音乐。模型能处理复杂的文本指令,生成具…
STORM AI – 斯坦福大学推出的开源AI写作工具
STORM AI 是什么 STORM AI 是斯坦福大学推出的开源AI写作工具,可在几秒钟内将一个主题转换为长篇文章/研究论文,完全免费,是 Perplexity Pag…
MIMO – 阿里智能研究院推出的可控角色AI视频合成框架
MIMO是什么 MIMO是阿里巴巴集团智能计算研究所推出的可控角色视频合成的新型AI框架,基于空间分解建模技术,将2D视频转换为3D空间代码,实现对角色、动作和场景的精确…
INFP – 音频驱动的生成逼真面部表情和头部姿态的AI框架
INFP是什么 INFP是音频驱动的头部生成框架,专为双人对话交互设计。能自动在对话音频引导下进行角色的转换,无需手动分配角色和角色切换。INFP包括两个阶段:基于动作头…
Roop – 开源的AI视频换脸工具
Roop是什么 Roop 是开源的AI视频换脸工具,Roop支持用户通过一张图片替换视频中的面部,无需复杂的数据集或训练过程。安装和使用需要一定的技术技能,适合有一定基础…
RD-Agent – 微软亚洲研究院推出开源的自动化研究与开发工具
RD-Agent是什么 RD-Agent是一个开源的自动化研究与开发(R&D)工具,由微软亚洲研究院推出。基于AI技术推动数据驱动的AI研发过程,专注于简化模型和…
Follow-Your-Canvas – 腾讯与清华合作推出的高分辨率视频扩展技术
Follow-Your-Canvas是什么 Follow-Your-Canvas 是由腾讯混元团队与清华大学等机构合作推出的一种高分辨率视频扩展技术。通过分布式处理和布局…
auto-video-generator – AI自动解说视频生成器
auto-video-generator是什么 auto-video-generator是AI自动解说视频生成器,能实现一键生成解说视频。用户只需输入主题,系统便自动撰写…
CursorCore – 程序员的AI编程辅助框架,对话形式交互理解上下文
CursorCore是什么 CursorCore是一个基于大型语言模型(LLMs)的编程辅助框架,用对话式交互帮助程序员更高效地编写和修改代码。框架整合编程过程中的各种信…
LightEval – Hugging Face推出的轻量级AI大模型评估工具
LightEval是什么 LightEval是Hugging Face推出的一款轻量级AI评估工具,专门用于评估大型语言模型(LLMs)。LightEval支持多任务处理…
DCLM-7B – 苹果公司与合作团队推出的开源小模型
DCLM-7B 是什么 DCLM-7B是由苹果公司联合研究团队推出的70亿参数开源小模型,性能超越Mistral-7B,接近Llama 3和Gemma。最近,苹果公司作为…
豆包AI视频模型 – 字节跳动推出的AI视频生成大模型:PixelDance和Seaweed
豆包AI视频模型是什么 豆包AI视频模型是字节跳动推出的两款AI视频生成大模型:PixelDance 和 Seaweed 。PixelDance基于DiT结构,擅长理解复…
VisionFM – 通用眼科AI大模型,具备少样本多种疾病诊断能力
VisionFM是什么 VisionFM(伏羲慧眼)是多模态多任务的视觉基础模型,专为通用眼科人工智能而设计。通过预训练3.4百万张来自560,457个个体的眼科图像,覆…
TurboEdit – Adobe推出的AI即时图像编辑模型
TurboEdit是什么 TurboEdit是Adobe Research 推出的AI即时图像编辑模型。通过编码器迭代反演和基于文本的精细控制,能够在几步内实现对图像的精…
