CrewAI – 构建多个 AI Agents 高效协作的开源平台
CrewAI是什么 CrewAI是专注于构建多个 AI Agents 高效协作的开源平台,通过简化 AI Agents 框架的使用,企业能快速构建和部署智能自动化解决方案…
阶跃星辰首款AI智能体手机即将发布,跑在OpenAI前面
国内通用大模型独角兽阶跃星辰官方宣布,将推出新一代智能体终端,带来Agent时代的新答案。据国内媒体爆料,阶跃星辰即将发布AI终端品牌、智能体系统及其首款AI智能体手机,…
Meta被曝研发全天候AI眼镜:支持超级感知与无感音视频捕捉
据《金融时报》报道,Meta正研发一款具备全天候多模态感知能力的智能眼镜原型机。该设备支持“超级感知”模式,能够以“每隔几秒”的频率连续录制音频并拍摄照片,用户可通过Me…
全球首部AI女演员主演电影开机:没有身体没有童年,却能调取全人类记忆
英国伦敦AI影视公司Particle6 正式宣布启动长片电影《Misaligned》的制作,主角将由公司打造的AI"演员"蒂莉·诺伍德担纲。片方称这将是"首部AI主演的长…
GameGen-O – 腾讯推出的游戏视频生成模型,自动生成角色、场景、动作和事件
GameGen-O是什么 GameGen-O 是腾讯推出的一款基于 Transformer 架构的游戏视频生成模型,专门用于生成开放世界视频游戏。模型能模拟游戏引擎的多种…
StreamingT2V – PicsArt推出的可生成长达2分钟视频的模型
StreamingT2V是什么 StreamingT2V是由PicsArt AI研究团队推出的一个文本到视频的生成模型,旨在解决现有模型仅能生成16帧或24帧的高质量短视…
GaussianEditor – 一种3D编辑算法,支持快速且精确地修改3D场景
GaussianEditor是什么 GaussianEditor 是一种基于高斯飞溅(Gaussian Splatting)的3D编辑算法,支持用户快速而精确地修改3D场…
Docmatix – 为文档视觉问答设计的超大开源数据集
Docmatix是什么 Docmatix 是一个用于文档视觉问答(Document Visual Question Answering,简称 DocVQA)任务设计的大规…
Toucan TTS – 免费开源的文本转语音工具,支持超7000种语言
Toucan TTS是什么 Toucan TTS是由德国斯图加特大学自然语言处理研究所(IMS)开发的文本到语音合成工具箱,支持超过7000种语言,包括多种方言和变体。T…
Boximator – 字节推出的控制视频生成中对象运动的框架
Boximator是什么? Boximator是由字节跳动的研究团队开发的一种视频合成技术,旨在生成丰富且可控的运动,以增强视频合成的质量和可控性。该技术通过引入两种类型…
LLaMA-Omni – 中科院推出的低延迟高质量的语音交互模型
LLaMA-Omni是什么 LLaMA-Omni 是中国科学院计算技术研究所和中国科学院大学研究者推出的新型模型架构,用于实现与大型语言模型(LLM)的低延迟、高质量语音…
EMMA-X – 新加坡科技设计大学推出的具身多模态动作模型
EMMA-X是什么 EMMA-X是新加坡科技设计大学推出的具有70亿参数的具身多模态动作模型,在有根据的链式思维(CoT)推理数据上微调OpenVLA创建。EMMA-X结…
HybridRAG – 黑石联合英伟达推出的混合检索增强生成架构
HybridRAG是什么 HybridRAG 是黑石联合英伟达推出的混合检索增强生成架构,结合了检索增强生成(Retrieval-Augmented Generation…
CogView3 – 智谱AI推出的开源AI图像生成模型
CogView3是什么 CogView3是清华大学联合智谱AI推出的开源AI图像生成模型,采用中继扩散技术。模型分阶段生成图像,首先创建低分辨率图像,然后通过中继超分辨率…
mPLUG-DocOwl2 – 阿里推出多页文档理解的多模态大模型,单页仅需324个token
mPLUG-DocOwl2是什么 mPLUG-DocOwl 2是由阿里巴巴通义实验室mPLUG团队推出的用于多页文档理解的多模态大型语言模型。在不依赖光学字符识别(OCR…
VoiceCraft – 开源的语音编辑和文本转语音模型
VoiceCraft是什么 VoiceCraft是一个由德克萨斯大学奥斯汀分校研究团队开源的神经编解码器语言模型,专注于零样本语音编辑和文本到语音(TTS)任务。该模型采…
