Chameleon – Meta推出的图文混合多模态开源模型
Chameleon是什么 Chameleon 是 Meta(Facebook 的母公司)的人工智能研究团队 FAIR(Facebook AI Research)发布的一个…
MMMLU – OpenAI推出的多语言大规模多任务语言理解数据集
MMMLU是什么 MMMLU(多语言大规模多任务语言理解)是OpenAI推出的一个开源数据集,为评估和提升人工智能模型在不同语言、认知和文化背景下的性能而设计。MMMLU…
RWKV-7 – RWKV系列的最新大模型架构版本,有强大的上下文学习能力
RWKV-7是什么 RWKV-7是RWKV系列的最新大模型架构版本,超越了传统的attention和linear attention范式,具有更灵活的状态演化能力,能在相…
Half_illustration – 基于Flux.1 的LoRA模型,让照片秒变艺术大片
Half_illustration是什么 Half_illustration是一个基于Flux.1模型的LoRA图像创意模型,融合了摄影写实与插画艺术的元素,创造出独特的…
ChatMLX – 高性能MacOS聊天应用,基于MLX框架实现与数据实时交互
ChatMLX是什么 ChatMLX是一个基于大型语言模型(LLM)的高性能MacOS聊天应用,基于MLX框架实现与数据的交互。应用通过自然语言处理技术,让用户与数据进行…
Nemotron-Mini-4B-Instruct – 英伟达推出的开源小型语言模型
Nemotron-Mini-4B-Instruct是什么 Nemotron-Mini-4B-Instruct是英伟达推出的一款开源小型语言模型,专为角色扮演、检索增强生成…
VASA-1 – 微软推出的静态照片对口型视频生成框架
VASA-1是什么 VASA-1是由微软亚洲研究院提出的一个将静态照片转换为对口型动态视频的生成框架,能够根据单张静态人脸照片和一段语音音频,实时生成逼真的3D说话面部动…
GLM-4V-Plus – 智谱AI最新推出的多模态AI模型,专注图像和视频理解
GLM-4V-Plus是什么 GLM-4V-Plus是智谱AI最新推出的多模态AI模型,专注于图像和视频理解。GLM-4V-Plus不仅能够精确分析静态图像,还具备动态视…
libcom – 上海交大推出开源的图像合成问题解决工具
libcom是什么 libcom 是一个由上海交通大学 (BCMI) 实验室推出的图像合成工具箱。旨在解决前景和背景之间的不一致性问题,如外观、几何和语义上的不匹配,生成…
ViewCrafter – 北大、港中文联合腾讯提出的高保真新视图合成技术
ViewCrafter是什么 ViewCrafter 是北大和港中文联合腾讯提出的一种先进的视频扩散模型,能从单个或少量图像中合成高保真的新视图。结合了视频扩散模型的生成…
Mem0 – 一款开源的大语言模型记忆增强工具
Mem0 是什么 Mem0 是一款开源的大语言模型记忆增强工具,能够让 AI 拥有长期、适应性强的记忆。通过自适应记忆系统,AI能实现跨应用记住用户的偏好和交互,提供连贯…
Llama 3.2 – Meta推出的中小型视觉语言模型和轻量级文本模型
Llama 3.2是什么 Llama 3.2是Meta公司最新推出的开源AI大模型系列,包括小型和中型视觉语言模型(11B和90B参数)以及轻量级纯文本模型(1B和3B参…
PromptWizard – 微软开源的 AI 提示词自动化优化框架
PromptWizard PromptWizard是微软推出的自动化提示优化框架,改进大型语言模型(LLMs)在特定任务中的表现。基于自我演变和自我适应机制,Prompt…
ProPainter – 南洋理工大学推出的AI视频修复项目
ProPainter是什么 ProPainter是南洋理工大学S-Lab团队推出的AI视频修复项目。通过结合双域传播和蒙版引导的稀疏视频Transformer,有效提高了…
CDial-GPT – 清华推出的大型中文短文本对话数据集和对话生成模型
CDial-GPT是什么 CDial-GPT是清华大学研究团队推出的大型中文短文本对话数据集LCCC及基于数据集的预训练对话生成模型。LCCC数据集经过严格的清洗流程,包…
PoseTalk – 文本和音频驱动的生成会说话的头部动画开源项目
PoseTalk是什么 PoseTalk 是基于文本和音频的姿势控制和运动细化方法的开源项目,用于一次性生成会说话的头部视频。从图像、驱动音频和驱动姿势合成说话人脸视频,…
