LongWriter – 清华联合智谱AI推出的长文本生成模型
LongWriter是什么 LongWriter 是清华大学联合智谱AI推出的长文本生成模型,能生成超10,000字的连贯文本,项目已开源。通过分析现有大型语言模型的输出…
MIP-Adapter – 阿里开源多参考图像融合的个性化图像生成技术
MIP-Adapter是什么 MIP-Adapter是一种个性化图像生成技术,由阿里巴巴集团推出并开源。基于IP-Adapter模型,进一步扩展其能力,支持同时处理多个参…
Jina-embeddings-v3 – 专为多语言和长文本上下文检索设计的文本嵌入模型
Jina-embeddings-v3是什么 Jina-embeddings-v3 是 Jina AI 推出的一款先进的文本嵌入模型,专为多语言数据处理和长文本上下文检索任…
Video-LLaVA2 – ChatLaw推出的开源多模态智能理解系统
Video-LLaVA2是什么 Video-LLaVA2是由北京大学ChatLaw课题组推出的开源多模态智能理解系统,通过创新的时空卷积(STC)连接器和音频分支,提升了…
Loong – 港大和字节联合推出的长视频生成模型
Loong是什么 Loong是由香港大学和字节跳动联合推出的一种新型长视频生成模型,能生成外观一致、动态丰富、场景过渡自然的分钟级长视频。模型基于自回归大型语言模型(LL…
蓝心大模型 – vivo推出的全新自研通用大模型矩阵,30亿端侧大模型
蓝心大模型是什么 蓝心大模型是vivo发布的全新自研通用大模型矩阵,包括语言大模型、端侧大模型、语音大模型、图像大模型以及多模态大模型。在多个领域和场景中发挥着重要作用,…
GraphReasoning – 将科学论文转换成知识图谱的AI应用框架
GraphReasoning是什么 GraphReasoning是一种基于人工智能技术将大量科学论文转换成知识图谱的方法。通过结构化分析,计算节点度、识别社区及其连通性,…
3D-Speaker – 阿里通义推出的多模态说话人识别任务开源项目
3D-Speaker是什么 3D-Speaker是阿里巴巴通义实验室语音团队推出的多模态开源项目,基于结合声学、语义、视觉信息,实现高精度的说话人识别和语种识别。3D-S…
源2.0-M32 – 浪潮信息推出的拥有32个专家的混合专家模型(MoE)
源2.0-M32是什么 源2.0-M32是浪潮信息推出的拥有32个专家的混合专家模型(MoE)。采用创新的”Attention Router”技术,提高了模型选择专家的效…
CapsWriter-Offline – AI语音转文字工具,PC端离线实时工作
CapsWriter-Offline是什么 CapsWriter-Offline是一款高效的PC端离线语音输入和字幕转录工具,支持用户通过简单的按键操作实现实时语音转文字…
Click2Mask – AI图像编辑技术,通过简单点击和内容描述实现智能编辑
Click2Mask是什么 Click2Mask 是一种先进的图像编辑技术,支持用户通过在图片上简单点击来实现局部编辑,无需复杂的遮罩或详细描述。通过动态生成遮罩,结合混…
MUMU – 文本和图像驱动的多模态生成模型
MUMU是什么 MUMU是一种多模态图像生成模型,通过结合文本提示和参考图像来生成目标图像,从而提高生成的准确率和质量。MUMU模型的架构基于SDXL的预训练卷积UNet…
ScriptViz – 斯坦福大学推出的剧本可视化AI辅助工具
ScriptViz是什么 ScriptViz是由斯坦福大学研究人员推出的一款剧本可视化辅助工具,基于大型电影数据库MovieNet,根据剧本文本和对话检索出相匹配的电影画…
VideoLLaMB – 开源的多模态长视频理解框架
VideoLLaMB VideoLLaMB 是一种创新的长视频理解框架,通过引入记忆桥接层和递归记忆令牌来处理视频数据,确保在分析时不丢失关键视觉信息。模型特别设计用于理…
Comic Translate – 开源的漫画翻译工具,自动翻译主流漫画阅读语言
Comic Translate是什么 Comic Translate 是一个开源的漫画翻译工具,由开发者 ogkalu2 推出。帮助用户自动翻译全球各地的漫画,支持英语、…
ERA-42 – 星动纪元推出的端到端原生机器人大模型
ERA-42是什么 ERA-42是北京星动纪元推出的端到端原生机器人大模型,与自研的五指灵巧手星动XHAND1结合,能完成100多种复杂灵巧操作任务。ERA-42无需预编…
