Kimi-VL – 月之暗面开源的轻量级多模态视觉语言模型
Kimi-VL是什么 Kimi-VL 是月之暗面开源的轻量级多模态视觉语言模型,基于轻量级MoE模型Moonlight(16B总参数,2.8B激活参数)和原生分辨率的Mo…
Liquid – 华中科技、字节、港大联合推出的统一多模态生成框架
Liquid是什么 Liquid是华中科技大学、字节跳动和香港大学联合推出的极简统一多模态生成框架。基于VQGAN将图像编码为离散的视觉token,与文本token共享同…
AI-Researcher – 香港大学推出的开源自动化科学研究工具
AI-Researcher是什么 AI-Researcher 是香港大学数据科学实验室推出的开源自动化科学研究工具,基于大型语言模型(LLM)代理实现从研究想法到论文发表…
InternVL – OpenGVLab 推出的多模态大模型
InternVL是什么 InternVL 是上海人工智能实验室 OpenGVLab 推出的多模态大模型,专注于视觉与语言任务。采用 ViT-MLP-LLM 架构,通过视觉…
DeepSeek-R1T-Chimera – TNG开源的语言模型
DeepSeek-R1T-Chimera是什么 DeepSeek-R1T-Chimera 是TNG科技公司推出的开源语言模型。结合 DeepSeek V3-0324 和D…
披着便利外衣的陷阱!国安部鸣枪警告:警惕“AI中转站”四大致命风险
随着人工智能应用需求的爆发式增长,批量提供海内外大模型访问服务的“AI中转站”在网络上迅速走红。这类平台通过统一整合各大厂商的应用程序接口(API),充当起用户与大模型之…
MT-Color – 上海交大联合哔哩哔哩推出的可控图像着色框架
MT-Color是什么 MT-Color是上海交通大学联合哔哩哔哩推出的基于扩散模型的可控图像着色框架,基于用户提供的实例感知文本和掩码实现精确的实例级图像着色。框架基于…
DeepSite – 基于 DeepSeek 开源的 AI 前端开发工具
DeepSite是什么 DeepSite 是基于 DeepSeek-V3 模型的在线开发工具,用户无需配置环境或安装软件,在网页上直接输入需求,快速生成游戏、应用或网页的…
AIMv2 – 苹果开源的多模态自回归预训练视觉模型
AIMv2是什么 AIMv2是苹果公司开源的多模态自回归预训练视觉模型,通过图像和文本的深度融合提升视觉模型的性能。采用创新的预训练框架,将图像划分为非重叠的图像块,将文…
腾讯发布首个智能体行业应用LearnBuddy,打造专家同行的AI自主学习平台
近日,在腾讯云AI产业应用大会上,腾讯正式发布Buddy家族首个行业应用产品LearnBuddy,并同步推出企业效率智能体套件、升级Agent云底座,进一步推动智能体技术…
MakeAnything – 新加坡国立大学开源的一致性图片序列生成框架
MakeAnything是什么 MakeAnything 是新加坡国立大学 Show Lab团队推出的基于扩散变换器(Diffusion Transformer)的多领域…
SkyReels-V2 – 昆仑万维开源的无限时长电影生成模型
SkyReels-V2是什么 SkyReels-V2是昆仑万维SkyReels团队推出的无限时长电影生成模型,基于扩散强迫(Diffusion-forcing)框架,结合…
MagicArticulate – 南洋理工和字节推出的静态 3D 模型转骨架生成框架
MagicArticulate是什么 MagicArticulate 是南洋理工大学和字节跳动Seed实验室推出的自动将静态 3D 模型转换为可动画化资产的框架。Magi…
MeshPad – 草图驱动的AI 3D网格生成与编辑工具
MeshPad是什么 MeshPad 是基于草图输入的交互式艺术化网格生成与编辑工具,能将简单的二维草图迅速转化为高质量的 3D 网格模型,支持实时编辑。用户在草图上添加…
Mistral Medium 3 – Mistral AI推出的多模态语言模型
Mistral Medium 3是什么 Mistral Medium 3是Mistral AI推出的多模态语言模型。模型在性能和成本之间实现平衡,接近达到Claude S…
TripoSR – Stability AI 联合 VAST 开源的 3D 生成模型
TripoSR是什么 TripoSR是Stability AI和VAST联合推出的开源3D生成模型,能在不到0.5秒内从单张2D图像快速生成高质量的3D模型。模型基于Tr…
