LMMs-Eval – 专为多模态AI模型设计的统一评估框架
LMMs-Eval是什么 LMMs-Eval 是一个专为多模态AI模型设计的统一评估框架,提供标准化、广泛覆盖且成本效益高的模型性能评估解决方案。包含超过50个任务和10…
PGTFormer – 先进的AI视频人脸修复框架
PGTFormer是什么 PGTFormer是先进的视频人脸修复框架,通过解析引导的时间一致性变换器来恢复视频中的高保真细节,同时增强时间连贯性。该方法无需预对齐,基于语…
Follow-Your-Emoji – 腾讯等推出的基于扩散模型的人像动画框架
Follow-Your-Emoji是什么 Follow-Your-Emoji是由香港科技大学、腾讯混元和清华大学的研究人员推出的一个基于扩散模型的人像动画框架,利用扩散模…
IP-Adapter – 腾讯开源的文本到图像扩散模型适配器
IP-Adapter是什么 IP-Adapter(Image Prompt Adapter)是一种专门为预训练的文本到图像扩散模型(如Stable Diffusion)设…
Linly-Dubbing – 开源AI视频工具,支持配音、翻译、对口型
Linly-Dubbing是什么 Linly-Dubbing是一个开源AI视频翻译和配音工具,支持配音、翻译、对口型,能自动将视频内容翻译成多种语言,并生成字幕。通过Wh…
VLOGGER – 谷歌推出的图像到合成人物动态视频的模型
VLOGGER是什么 VLOGGER AI是谷歌的研究团队开发的一个多模态扩散模型,专门用于从单一输入图像和音频样本生成逼真的、连贯的人像动态视频。该模型的主要功能在于使…
MooER – 摩尔线程推出的业界首个音频理解大模型
MooER是什么 MooER是摩尔线程推出的业界首个基于国产全功能GPU训练的开源音频理解大模型。不仅能进行中文和英文的语音识别,还具备中译英的语音翻译能力。MooER在…
HivisionIDPhotos – 免费开源的AI证件照制作工具
HivisionIDPhotos是什么 HivisionIDPhoto 是一款基于 AI 的轻量级证件照制作工具,能智能识别和抠图,快速生成符合多种规格的证件照。支持自定…
ToonCrafter – 腾讯等开源的卡通动画视频插帧工具
conda create -n tooncrafter python=3.8.5 conda activate tooncrafter pip install -r re…
OLMo – 艾伦AI研究所开源的完全开放的大语言模型框架
OLMo是什么? OLMo(Open Language Model)是由Allen AI(AI2,艾伦人工智能研究所)开发的一个完全开源开放的大型语言模型(LLM)框架,…
VITA – 腾讯推出的开源多模态AI模型
VITA是什么 VITA是腾讯优图实验室推出的全球首个开源多模态大语言模型(MLLM),能理解和处理视频、图像、文本和音频。基于Mixtral 8×7B模型,扩展了中文词…
Torch-MLU – 寒武纪开源的PyTorch后端插件,支持大模型一键迁移
Torch-MLU是什么 Torch-MLU 是寒武纪开源的 PyTorch 设备后端扩展插件,支持开发者将寒武纪 MLU 系列智能加速卡作为 PyTorch 的加速后端…
Stable Video 3D (SV3D) – 多视角合成和3D生成模型,由Stability AI推出
Stable Video 3D是什么 Stable Video 3D(简称SV3D)是由Stability AI公司开发的一个多视角合成和3D生成模型,能够从单张图片生成…
StockBot – 基于Llama3的AI金融Agent,提升股票投资效率
StockBot 是什么 StockBot 是一个基于Llama3的AI金融Agent,提供实时股票信息、财务数据、新闻和互动图表。支持多资产市场,包括股票、外汇、债券和…
Step-1X – 阶跃星辰推出的AI图像生成大模型
Step-1X是什么 Step-1X 是阶跃星辰推出的AI图像生成大模型,采用自研的 DiT 架构,擅长深度语义理解和细节生成。Step-1X支持长达2000字符的复杂指…
Stability AI开源Stable Diffusion 3 Medium文生图模型
6月12日晚间消息,人工智能初创公司Stability AI宣布正式开源发布其最新的文本到图像生成模型——Stable Diffusion 3 Medium(SD3 Me…
