Enhance-A-Video – 上海AI Lab 联合新加坡国立等推出的视频生成质量增强算法
Enhance-A-Video是什么 Enhance-A-Video 是新加坡国立大学、上海人工智能实验室和德克萨斯大学奥斯汀分校联合推出的视频生成增强算法。算法能够显著…
Valley – 字节跳动推出的多模态大模型
Valley是什么 Valley是字节跳动推出的多模态大模型,用于处理涉及文本、图像和视频数据的多样化任务。Valley在内部电子商务和短视频基准测试中取得了最佳成绩,并…
联通元景 – 中国联通AI开源的中文原生文生图模型
联通元景是什么 联通元景(UniT2IXL)是中国联通AI推出的中文原生文生图模型,完全在国产昇腾AI基础软硬件平台上实现训练和推理。模型采用复合语言编码模块,优化中文长…
DiTCtrl – 港中文联合腾讯等机构推出的多提示视频生成方法
DiTCtrl是什么 DiTCtrl是基于多模态扩散变换器(MM-DiT)架构的多提示视频生成方法,是香港中文大学和腾讯等机构联合推出的。DiTCtrl能在无需额外训练的…
MNN – 阿里开源的移动端深度学习推理框架
MNN是什么 MNN(Mobile Neural Network)是阿里巴巴集团开源的轻量级深度学习推理框架,为移动端、服务器、个人电脑、嵌入式设备等多种设备提供高效的模…
启元重症大模型 – 腾讯和迈瑞医疗联合推出的重症医疗大模型
启元重症大模型是什么 启元重症大模型是腾讯和迈瑞医疗联合发布的全球首个重症医疗大模型,专为ICU病房设计,解决重症监护中的痛点问题。模型整体参数量达到万亿级别,经过大量医…
Poetry2Image – 专为中文古诗词图像生成设计的迭代校正框架
Poetry2Image是什么 Poetry2Image是一个专为中文古诗词图像生成设计的迭代校正框架,哈尔滨工业大学提出。框架通过自动化的反馈和校正循环,增强了诗歌与图…
PeterCat – AI问答机器人,自动抓取 GitHub 上的文档和 issue 作为知识库
PeterCat是什么 PeterCat是开源的智能答疑机器人助手。PeterCat能帮助开发者和社区维护者更高效地解决技术问题,提升社区支持效率。PeterCat基于自…
PartGen – 牛津大学联合 Meta AI 推出的3D对象生成和重建框架
PartGen是什么 PartGen是先进的3D对象生成和重建框架,是牛津大学的视觉几何小组和Meta AI共同推出的。PartGen能识别并生成由有意义部分组成的3D对…
Vision Parse – 开源的 PDF 转 Markdown 工具
Vision Parse是什么 Vision Parse是开源的PDF文档转换工具,基于视觉语言模型(Vision LLMs)将PDF文件转换成Markdown格式。Vi…
The Language of Motion – 斯坦福李飞飞团队推出的统一多模态语言模型
The Language of Motion是什么 The Language of Motion是斯坦福大学李飞飞团队推出的多模态语言模型,能整合人类动作中的言语和非言语…
Mathtutor on Groq – AI数学辅导工具,支持用语音形式提出数学问题
Mathtutor on Groq是什么 Mathtutor on Groq 是基于 Groq 架构的AI数学辅导工具,基于语音识别功能,支持用户用语音形式提出数学问题。…
VE-Bench – 北京大学开源首个针对视频编辑质量评估的新指标
VE-Bench是什么 VE-Bench 是北京大学的研究团队 MMCAL 最近发布首个专门针对视频编辑质量评估的指标。VE-Bench 的设计目标是与人类感知能力高度一…
EDTalk – 上海交大联合网易推出高效解耦的情感说话头像合成模型
EDTalk是什么 EDTalk是上海交通大学联合网易研发的音频驱动唇部同步模型,能实现对嘴型、头部姿态和情感表情的独立操控。只需上传一张图片、一段音频和参考视频,就能驱…
video-analyzer – AI 视频分析工具,提取视频关键帧、生成视频详细描述
video-analyzer是什么 video-analyzer 是开源的视频分析工具,结合Llama的11B视觉模型和OpenAI的Whisper模型来提取视频关键帧、…
SPAR – 智谱团队推出的自我博弈训练框架
SPAR是什么 SPAR是智谱团队推出的自我博弈框架,能增强大型语言模型在遵循指令方面的能力。框架基于内部的生成者和完善者两个角色进行互动,生成者执行指令生成回复,完善者…
