Qwen2.5-1M – 阿里通义千问开源的语言模型,支持100万Tokens上下文
Qwen2.5-1M是什么 Qwen2.5-1M是阿里通义千问团队推出的开源模型,支持100万Tokens的上下文长度。模型包括Qwen2.5-7B-Instruct-1…
Wear-Any-Way – 阿里拍立淘团队推出自由定制的虚拟试穿框架
Wear-Any-Way是什么 Wear-Any-Way是阿里巴巴拍立淘团队推出的创新的虚拟试穿框架。通过稀疏对应对齐机制,实现了高保真度且可定制的虚拟试穿效果。用户可以…
Riona-AI-Agent – AI社交工具,可在社交媒体平台自动化交互点赞评论
Riona-AI-Agent是什么 Riona-AI-Agent是Node.js 和 TypeScript 构建的 AI 驱动的自动化工具,能与 Instagram、Tw…
QwQ-Max – 阿里推出的深度推理模型,基于 Qwen2.5-Max
QwQ-Max是什么 QwQ-Max是阿里巴巴基于Qwen2.5-Max推出的深度推理模型,是 Qwen 系列的一部分。QwQ-Max-Preview作为预览版本推出,Q…
GLM-Zero – 智谱AI推出的深度推理模型
GLM-Zero是什么 GLM-Zero是智谱AI基于扩展强化学习技术的推理模型,专注于提升模型的深度推理能力。擅长处理数理逻辑、代码编写和复杂问题解决,在AIME 20…
SPRIGHT – 专注于空间关系的大型视觉语言数据集
SPRIGHT是什么 SPRIGHT(SPatially RIGHT)是亚利桑那州立大学 、Intel 实验室 、Hugging Face 、华盛顿大学等机构联合推出的,…
ENEL – 上海 AI Lab 推出的无编码器3D大型多模态模型
ENEL是什么 ENEL(Exploring the Potential of Encoder-free Architectures in 3D LMMs)是创新的无编码…
MoBA – Moonshot AI 提出的新型注意力机制
MoBA是什么 MoBA(Mixture of Block Attention)是 Moonshot AI 提出的新型注意力机制,提高大型语言模型(LLMs)处理长上下文…
BGE-VL – 智源研究院联合多所高校开源的多模态向量模型
BGE-VL是什么 BGE-VL 是北京智源研究院联合多所高校推出的多模态向量模型,基于大规模合成数据 MegaPairs 训练而成。BGE-VL专注于多模态检索任务,如…
MotionCanvas – 港中文和 Adobe 等机构推出的可控图像到视频生成方法
MotionCanvas是什么 MotionCanvas是香港中文大学、Adobe 研究院和莫纳什大学推出的图像到视频(I2V)生成方法,能将静态图像转化为具有丰富动态效…
VideoJAM – Meta 推出增强视频生成模型运动连贯性的框架
VideoJAM是什么 VideoJAM是Meta推出的,用在增强视频生成模型运动连贯性的框架。基于引入联合外观-运动表示,让模型在训练阶段同时学习预测视频的像素和运动信…
星火医疗大模型X1 – 讯飞医疗推出的深度推理大模型
星火医疗大模型X1是什么 星火医疗大模型X1是科大讯飞发布的深度推理大模型,专门针对医疗领域设计,具备强大的复杂问题处理能力。模型通过深度推理算法,能逐步解释循证过程,显…
DiffuEraser – 阿里通义实验室推出的视频修复模型
DiffuEraser是什么 DiffuEraser是基于稳定扩散模型的视频修复模型,以更丰富的细节和更连贯的结构填充视频中的遮罩区域。模型通过结合先验信息来提供初始化和…
GameFactory – 香港大学和快手联合推出的可泛化游戏场景框架
GameFactory是什么 GameFactory 是香港大学和快手科技联合提出的创新框架,解决游戏视频生成中的场景泛化难题。框架基于预训练的视频扩散模型,结合开放域视…
Prometheus – 浙大联合蚂蚁等高校推出的3D感知潜在扩散模型
Prometheus是什么 Prometheus是创新的3D感知潜在扩散模型,专门用于快速生成文本到3D场景的内容。能在几秒钟内完成对象和场景级别的3D生成,同时保持高质…
Step1X-3D – 阶跃星辰联合LightIllusions开源的3D资产生成框架
Step1X-3D是什么 Step1X-3D 是StepFun联合LightIllusions推出的高保真、可控的 3D 资产生成框架。基于严格的数据整理流程,从超过 5…
