LongCite – 清华推出的开源模型,提升LLMs的精准引用减少幻觉
LongCite是什么 LongCite是由清华大学推出的项目,旨在提升大型语言模型(LLMs)在长文本问答任务中的可信度和可验证性。项目通过生成细粒度的句子级引用,使用…
BrushNet – 腾讯推出的高质量图像照片修复模型
BrushNet是什么 BrushNet是由腾讯PCG部门的ARC实验室与香港大学的研究人员推出的一个基于扩散模型的即插即用的图像照片修复(Inpainting)模型,通…
TrackGo – 先进的可控AI视频生成技术
TrackGo是什么 TrackGo是一种先进的可控AI视频生成技术,通过用自由形状的遮罩和箭头,为用户提供了一种灵活而精确的机制来控制视频中对象的运动。技术的核心是Tr…
NanoFlow – 优化大语言模型推理吞吐量的服务框架
NanoFlow是什么 NanoFlow 是一个高性能的服务框架,专为大型语言模型(LLMs)设计,以提高模型的推理吞吐量。它通过在单个设备内部并行使用计算、内存和网络资…
Diffutoon – 阿里推出的AI将视频转卡通风格的框架
Diffutoon是什么 Diffutoon是由阿里巴巴和华东师大的研究人员推出的一个将视频转换为卡通动漫风格的AI框架,基于扩散模型的可编辑卡通着色技术,能够将真实感视…
Depth Anything – Tiktok等推出的单目深度估计模型
Depth Anything是什么? Depth Anything是由来自Tiktok、香港大学和浙江大学的研究人员推出的一个为单目深度估计(Monocular Dept…
FACTS Grounding – 谷歌推出的评估大模型能力的基准测试
FACTS Grounding是什么 FACTS Grounding是谷歌DeepMind推出的评估大型语言模型(LLMs)能力的基准测试,衡量模型根据给定上下文生成事实…
Llama-3.1-Minitron – 英伟达联合Meta推出的Llama 3.1 4B参数模型
Llama-3.1-Minitron是什么 Llama-3.1-Minitron是由英伟达和Meta合作开发的AI模型,通过剪枝和知识蒸馏技术从Llama 3.1 8B模…
CSGO AI – 小红书联合南理工推出的AI文生图项目
CSGO是什么 CSGO(Content-Style Composition in Text-to-Image Generation)是南京理工大学、小红书等机构合作推出…
SUPIR – 高保真的AI图像修复和画质增强模型
SUPIR是什么 SUPIR(Scaling-UP Image Restoration)是一个突破性的图像修复和画质增强方法,利用了大规模的生成模型StableDiffu…
GPT Pilot – AI编程工具,让95%的开发者实现自动写代码
GPT Pilot是什么 GPT Pilot 是一款AI编程工具,通过模仿人类开发者的工作流程,帮助从零开始构建应用程序。能编写代码、调试程序、与用户讨论问题,并请求代码…
ChatLearn – 阿里云推出的灵活、易用、高效的大规模 Alignmant 训练框架
ChatLearn是什么 ChatLearn 是由阿里云推出的一个灵活、易用、高效的大规模Alignmant 训练框架。ChatLearn是为了支持大型语言模型(LLMs…
ExVideo – 阿里和华东师大推出的AI视频长度扩展调优技术
ExVideo是什么 ExVideo是由阿里巴巴和华东师大的研究人员推出的一种视频合成模型的后调优技术,能够扩展现有视频合成模型的时间尺度,以生成更长和帧数更多的视频。该…
V-JEPA:Meta推出的视觉模型,可以通过观看视频来学习理解物理世界
V-JEPA是什么? V-JEPA(Video Joint-Embedding Predictive Architecture,视频联合嵌入预测架构)是由Meta的研究人…
LVCD – 腾讯联合香港城市大学推出为动漫视频线稿上色的AI框架
LVCD是什么 LVCD(Large Video Color Diffusion)是一个专为动画视频线稿上色设计的视频扩散框架,能将黑白线稿自动转化为彩色动画视频。LVC…
MarkItDown – 微软开源的多功能、多格式文档转Markdown工具
MarkItDown是什么 MarkItDown是微软开源的多功能文档转换工具,能将PDF、PPT、Word、Excel、图像、音频、HTML等多种格式的文件转换成Mar…
