MimicBrush – 阿里等开源的AI图像编辑融合框架
MimicBrush是什么 MimicBrush是由阿里巴巴、香港大学和蚂蚁集团的研究人员推出的AI图像编辑融合框架,允许用户通过简单的操作,在源图像上指定需要编辑的区域…
MetaGPT – 多个AI智能体协作分工的框架
MetaGPT是什么? MetaGPT是一个创新的元编程框架,结合了大语言模型和多智能体协作系统,旨在通过模拟人类工作流程来解决复杂问题。该框架的核心在于将标准化操作程序…
OpenAI炮轰AI评测”标杆”: 731 道题近三成有缺陷, 8 个月通过率从23%飙到80%已失灵
OpenAI发布博文公开挑战行业权威评测基准SWE-Bench Pro,认为在 731 个公开测试任务中,约30%存在评测缺陷。SWE-Bench Pro由Scale A…
ControlNeXt – AI图像和视频可控生成框架
ControlNeXt是什么 ControlNeXt是一种新型的AI图像和视频可控生成框架,由香港中文大学和商汤科技联合开发。采用轻量化控制模块和创新的交叉归一化技术,大…
LlamaCoder – 开发者的AI工具,快速创建全栈应用程序
LlamaCoder LlamaCoder 是一个开源的 AI 工具,使用 Llama 3.1 405B 模型快速生成全栈应用程序。旨在提供一种替代 Claude Art…
StreamMultiDiffusion – 实时生成和编辑图像的交互式框架
StreamMultiDiffusion是什么 StreamMultiDiffusion是一个开源的实时交互式的图像生成框架,结合了扩散模型的高质量图像合成能力和区域控制…
Bark – Suno AI 推出的开源文本到音频模型
Bark是什么 Bark是Suno AI 推出的开源文本到音频模型,能生成逼真的多语言语音和多种音频类型,包括音乐、背景噪音等,同时支持非语言交流如笑声和哭泣。Bark提…
Yi-Coder – 零一万物开源的AI编程助手模型,提供1.5B和9B两种参数
Yi-Coder是什么 Yi-Coder是零一万物推出的开源AI编程助手系列模型,专为提升代码生成、理解、调试和补全等任务的效率而设计。Yi-Coder系列模型包含1.5…
Hallo – 复旦百度等开源的AI对口型肖像视频生成框架
Hallo是什么 Hallo是由复旦大学、百度公司、苏黎世联邦理工学院和南京大学的研究人员共同提出的一个AI对口型肖像图像动画技术,可基于语音音频输入来驱动生成逼真且动态…
Make-A-Character:阿里开源的AI 3D数字人生成框架
Make-A-Character是什么? Make-A-Character(简称Mach)是一个由阿里巴巴集团智能计算研究院开发的一个人工智能3D数字人生成框架,旨在通过…
豆包视觉理解模型 – 豆包推出视觉理解模型,具备识别和推理能力
豆包视觉理解模型是什么 豆包视觉理解模型是豆包推出的先进AI大模型,具备视觉识别和理解推理能力。豆包视觉理解模型具备强大的视觉定位能力,支持多目标、小目标及通用目标的框定…
FancyVideo – 360推出的AI文生视频模型
FancyVideo是什么 FancyVideo是360联合中山大学推出的AI文生视频模型。基于创新的跨帧文本引导模块(Cross-frame Textual Guida…
XVERSE-MoE-A36B – 元象开源的国内最大MoE模型,推理性能提升100%
XVERSE-MoE-A36B是什么 XVERSE-MoE-A36B是由元象推出的中国最大的MoE(Mixture of Experts,混合专家模型)开源大模型。模型具…
Mora – 微软等推出的可生成12秒视频的多AI智能体框架
Mora是什么 Mora是由来自微软和理海大学的研究人员推出的一个多智能体(AI Agents)框架,专门用于通用视频生成任务,目标是模拟并扩展OpenAI的Sora视频…
eSearch – 开源的AI桌面应用,截屏、OCR、搜索、翻译、录屏
eSearch是什么 eSearch是一款开源的跨平台AI桌面应用,集成了截屏、OCR识别、搜索翻译、贴图、以图搜图和屏幕录制等功能。eSearch基于Electron框…
Grok 4.5 – SpaceXAI推出的新一代旗舰大语言模型
Grok 4.5是什么 Grok 4.5是SpaceXAI(原xAI)推出的新一代旗舰大语言模型,基于1.5万亿参数V9基础架构。模型在补充训练阶段深度整合Cursor编…
