MuCodec – 清华、腾讯AI、港中文共同推出的超低比特率音乐编解码器
MuCodec是什么 MuCodec是清华大学深圳国际研究生院、腾讯AI实验室和香港中文大学的研究人员共同推出的超低比特率音乐编解码器,能实现音乐的高效压缩与高保真重建。…
Find3D – 加州理工学院推出的3D部件分割模型
Find3D是什么 Find3D是加州理工学院推出的3D部件分割模型,能根据任意文本查询分割任意对象的任何部分。Find3D用一个强大的数据引擎自动从互联网上的3D资产生…
Sketch2Lineart – AI绘画工具,自动将手绘草图转换成清晰的线条画
Sketch2Lineart是什么 Sketch2Lineart是基于人工智能的绘画工具,能将简单的手绘草图转换成清晰的线条画。通过自动生成草图描述并据此绘制线条画,支持…
Fancy123 – 华中科技和华南理工推出的3D网格生成技术
Fancy123是什么 Fancy123是华中科技大学和华南理工大学推出的3D网格生成技术,基于即插即用的变形技术从单张图片生成高质量的3D网格。该方法包含两个增强模块和…
Mooncake – 月之暗面Kimi联合清华等机构推出的大模型推理架构
Mooncake是什么 Mooncake是月之暗面Kimi联合清华大学等机构共同开源的大模型推理架构。采用以KVCache为中心的分布式架构,通过分离预填充和解码集群,充…
QwQ-32B-Preview – 阿里开源的AI推理模型,基准测试超越 o1 模型
QwQ-32B-Preview是什么 QwQ-32B-Preview(QwQ-32B)是阿里推出的开源AI推理模型,在数学和编程领域表现卓越。QwQ-32B-Previe…
InfiMM-WebMath-40B – 字节联合中科院开源的超大规模多模态数据集
InfiMM-WebMath-40B是什么 InfiMM-WebMath-40B 是字节跳动和中国科学院联合开源的超大规模多模态数据集,旨在提升多模态模型的图文混合推理能…
DramaClaw – 工业级 AI 视频制作工具,提供一站式流水线
DramaClaw是什么 DramaClaw 是工业级 AIGC 视频制作工具,主要面向 AI 短剧、漫剧、小说推文、解说剧等多类型视频创作场景。工具基于自研灵山 AI …
SeFi-Image – 开源的文本到图像模型,基于语义优先扩散
SeFi-Image是什么 SeFi-Image 是基于语义优先扩散的文本到图像模型,提供 1B、2B、5B 三种规格。模型将高层语义结构与纹理细节分离,让语义流提前去噪…
SAM 2.1 – Meta 开源的视觉分割模型
SAM 2.1是什么 SAM 2.1(全称Segment Anything Model 2.1)是Meta(Facebook的母公司)推出的先进视觉分割模型,用于图像和视…
Qwen2vl-Flux – 开源的多模态图像生成模型,支持多种生成模式
Qwen2vl-Flux是什么 Qwen2VL-Flux是多模态图像生成模型,结合Qwen2VL的视觉语言理解和FLUX框架,基于文本提示和图像参考生成高质量的图像。模型…
ShowUI – 新加坡国立联合微软推出用于 GUI 自动化的视觉-语言-操作模型
ShowUI是什么 ShowUI是新加坡国立大学Show Lab和微软共同推出的视觉-语言-行动模型,能提升图形用户界面(GUI)助手的工作效率。模型基于UI引导的视觉令…
NVLM – 英伟达推出的多模态大型语言模型
NVLM是什么 NVLM是NVIDIA推出的前沿多模态大型语言模型(LLMs),在视觉-语言任务上达到与顶尖专有模型(如GPT-4o)和开放访问模型(如Llama 3-V…
Promptriever – 信息检索模型,支持自然语言提示响应用户搜索需求
Promptriever是什么 Promptriever 是约翰斯·霍普金斯大学和Samaya AI联合推出的新型检索模型,能像语言模型一样接受自然语言提示,用直观的方式…
LongLLaVA – 香港中文大学推出的多模态上下文混合架构大语言模型
LongLLaVA是什么 LongLLaVA是的多模态大型语言模型(MLLM),是香港中文大学(深圳)的研究人员推出。基于混合架构,结合Mamba和Transformer…
Devika – 开源的AI编程工具,理解和执行复杂的人类指令
Devika 是什么 Devika是开源的AI编程工具,能理解并拆分复杂指令,基于集成AI搜索和网页浏览能力搜集信息,编写代码实现目标。Devika支持多种AI模型,具备…
