ChatLearn – 阿里云推出的灵活、易用、高效的大规模 Alignmant 训练框架
ChatLearn是什么 ChatLearn 是由阿里云推出的一个灵活、易用、高效的大规模Alignmant 训练框架。ChatLearn是为了支持大型语言模型(LLMs…
ExVideo – 阿里和华东师大推出的AI视频长度扩展调优技术
ExVideo是什么 ExVideo是由阿里巴巴和华东师大的研究人员推出的一种视频合成模型的后调优技术,能够扩展现有视频合成模型的时间尺度,以生成更长和帧数更多的视频。该…
V-JEPA:Meta推出的视觉模型,可以通过观看视频来学习理解物理世界
V-JEPA是什么? V-JEPA(Video Joint-Embedding Predictive Architecture,视频联合嵌入预测架构)是由Meta的研究人…
LVCD – 腾讯联合香港城市大学推出为动漫视频线稿上色的AI框架
LVCD是什么 LVCD(Large Video Color Diffusion)是一个专为动画视频线稿上色设计的视频扩散框架,能将黑白线稿自动转化为彩色动画视频。LVC…
MarkItDown – 微软开源的多功能、多格式文档转Markdown工具
MarkItDown是什么 MarkItDown是微软开源的多功能文档转换工具,能将PDF、PPT、Word、Excel、图像、音频、HTML等多种格式的文件转换成Mar…
CrewAI – 构建多个 AI Agents 高效协作的开源平台
CrewAI是什么 CrewAI是专注于构建多个 AI Agents 高效协作的开源平台,通过简化 AI Agents 框架的使用,企业能快速构建和部署智能自动化解决方案…
阶跃星辰首款AI智能体手机即将发布,跑在OpenAI前面
国内通用大模型独角兽阶跃星辰官方宣布,将推出新一代智能体终端,带来Agent时代的新答案。据国内媒体爆料,阶跃星辰即将发布AI终端品牌、智能体系统及其首款AI智能体手机,…
Meta被曝研发全天候AI眼镜:支持超级感知与无感音视频捕捉
据《金融时报》报道,Meta正研发一款具备全天候多模态感知能力的智能眼镜原型机。该设备支持“超级感知”模式,能够以“每隔几秒”的频率连续录制音频并拍摄照片,用户可通过Me…
全球首部AI女演员主演电影开机:没有身体没有童年,却能调取全人类记忆
英国伦敦AI影视公司Particle6 正式宣布启动长片电影《Misaligned》的制作,主角将由公司打造的AI"演员"蒂莉·诺伍德担纲。片方称这将是"首部AI主演的长…
GameGen-O – 腾讯推出的游戏视频生成模型,自动生成角色、场景、动作和事件
GameGen-O是什么 GameGen-O 是腾讯推出的一款基于 Transformer 架构的游戏视频生成模型,专门用于生成开放世界视频游戏。模型能模拟游戏引擎的多种…
StreamingT2V – PicsArt推出的可生成长达2分钟视频的模型
StreamingT2V是什么 StreamingT2V是由PicsArt AI研究团队推出的一个文本到视频的生成模型,旨在解决现有模型仅能生成16帧或24帧的高质量短视…
GaussianEditor – 一种3D编辑算法,支持快速且精确地修改3D场景
GaussianEditor是什么 GaussianEditor 是一种基于高斯飞溅(Gaussian Splatting)的3D编辑算法,支持用户快速而精确地修改3D场…
Docmatix – 为文档视觉问答设计的超大开源数据集
Docmatix是什么 Docmatix 是一个用于文档视觉问答(Document Visual Question Answering,简称 DocVQA)任务设计的大规…
Toucan TTS – 免费开源的文本转语音工具,支持超7000种语言
Toucan TTS是什么 Toucan TTS是由德国斯图加特大学自然语言处理研究所(IMS)开发的文本到语音合成工具箱,支持超过7000种语言,包括多种方言和变体。T…
Boximator – 字节推出的控制视频生成中对象运动的框架
Boximator是什么? Boximator是由字节跳动的研究团队开发的一种视频合成技术,旨在生成丰富且可控的运动,以增强视频合成的质量和可控性。该技术通过引入两种类型…
LLaMA-Omni – 中科院推出的低延迟高质量的语音交互模型
LLaMA-Omni是什么 LLaMA-Omni 是中国科学院计算技术研究所和中国科学院大学研究者推出的新型模型架构,用于实现与大型语言模型(LLM)的低延迟、高质量语音…
