AuraFlow – Fal团队推出的开源AI文生图模型
AuraFlow v0.1是什么 AuraFlow v0.1是Fal团队推出的开源AI文生图模型,拥有6.8B参数量。优化了MMDiT架构,提升了模型的计算效率和可扩展性…
Laminar – 分析与优化LLM应用程序的开源平台
Laminar是什么 Laminar是一个开源的可观测性和分析平台,专为大型语言模型(LLM)应用程序设计。Laminar提供一套完整的工具追踪、评估、注释和分析LLM数…
SwiftBrush V2 – 文本到图像的单步扩散模型,性能与多步模型相媲美
SwiftBrush V2是什么 SwiftBrush V2 是文本到图像的单步扩散模型,通过改进训练方法和模型融合技术,实现与多步Stable Diffusion扩散模…
LM Studio – 开源、傻瓜、一站式部署本地大模型 (LLM) 的应用平台
LM Studio是什么 LM Studio 是一个本地大语言模型 (LLM) 应用平台,开源、傻瓜、一站式部署本地大模型。包括但不限于Llama、MPT、Gemma等,…
Illuminate – 谷歌推出将学术论文转化为音频讨论的AI项目
Illuminate是什么 Illuminate 是一个由谷歌开发的项目,能将学术论文转化为人工智能生成的音频讨论。项目基于谷歌强大的语言模型 Gemini,将论文内容转…
Deepfake Defenders – 中科院开发的识别Deepfake伪造内容的AI模型
Deepfake Defenders是什么 Deepfake Defenders是由中国科学院自动化研究所的团队VisionRush开发的一款开源AI模型,旨在识别和防御…
PDF2Audio – 将PDF文档转换成音频博客的开源工具
PDF2Audio是什么 PDF2Audio 是一个开源工具,能将 PDF 文档转换成音频内容,适合制作播客、讲座或摘要。它基于 OpenAI 的 GPT 模型生成播客脚…
LeviTor – 南大联合蚂蚁等机构开源的3D目标轨迹控制视频合成技术
LeviTor是什么 LeviTor是南京大学、蚂蚁集团、浙江大学等机构推出的图像到视频合成技术,结合深度信息和K-means聚类点控制视频中3D物体的轨迹,无需显式的3…
LongWriter – 清华联合智谱AI推出的长文本生成模型
LongWriter是什么 LongWriter 是清华大学联合智谱AI推出的长文本生成模型,能生成超10,000字的连贯文本,项目已开源。通过分析现有大型语言模型的输出…
MIP-Adapter – 阿里开源多参考图像融合的个性化图像生成技术
MIP-Adapter是什么 MIP-Adapter是一种个性化图像生成技术,由阿里巴巴集团推出并开源。基于IP-Adapter模型,进一步扩展其能力,支持同时处理多个参…
Jina-embeddings-v3 – 专为多语言和长文本上下文检索设计的文本嵌入模型
Jina-embeddings-v3是什么 Jina-embeddings-v3 是 Jina AI 推出的一款先进的文本嵌入模型,专为多语言数据处理和长文本上下文检索任…
Video-LLaVA2 – ChatLaw推出的开源多模态智能理解系统
Video-LLaVA2是什么 Video-LLaVA2是由北京大学ChatLaw课题组推出的开源多模态智能理解系统,通过创新的时空卷积(STC)连接器和音频分支,提升了…
Loong – 港大和字节联合推出的长视频生成模型
Loong是什么 Loong是由香港大学和字节跳动联合推出的一种新型长视频生成模型,能生成外观一致、动态丰富、场景过渡自然的分钟级长视频。模型基于自回归大型语言模型(LL…
蓝心大模型 – vivo推出的全新自研通用大模型矩阵,30亿端侧大模型
蓝心大模型是什么 蓝心大模型是vivo发布的全新自研通用大模型矩阵,包括语言大模型、端侧大模型、语音大模型、图像大模型以及多模态大模型。在多个领域和场景中发挥着重要作用,…
GraphReasoning – 将科学论文转换成知识图谱的AI应用框架
GraphReasoning是什么 GraphReasoning是一种基于人工智能技术将大量科学论文转换成知识图谱的方法。通过结构化分析,计算节点度、识别社区及其连通性,…
3D-Speaker – 阿里通义推出的多模态说话人识别任务开源项目
3D-Speaker是什么 3D-Speaker是阿里巴巴通义实验室语音团队推出的多模态开源项目,基于结合声学、语义、视觉信息,实现高精度的说话人识别和语种识别。3D-S…
