Ichigo – 开源的多模态AI语音助手,实时处理语音和文本的交织序列
Ichigo是什么 Ichigo是开源的多模态AI语音助手,采用混合模态模型,能实时处理语音和文本的交织序列。基于将语音直接量化为离散令牌,用统一的变换器架构同时处理语音…
CogSound – 智谱AI最新推出的音效模型
CogSound是什么 CogSound是智谱AI最新推出的音效模型,能为无声视频增添动人的音效。 基于GLM-4V的视频理解能力,CogSound能精准识别理解视频背后…
AgentSquare – 清华推出模块化智能体系统设计和搜索新框架
AgentSquare是什么 AgentSquare是清华大学团队推出自动在模块化设计空间中搜索大型语言模型代理。基于标准化的模块接口抽象,实现AI智能体的高速自我演化和…
Fashion-VDM – 谷歌和华盛顿大学联合推出的虚拟试穿技术
Fashion-VDM是什么 Fashion-VDM是谷歌和华盛顿大学共同推出的基于视频扩散模型(VDM)的虚拟试穿技术。能在给定服装图像和人物视频的情况下,生成人物穿着…
olly.bot – 个人AI助理,集成多种通用AI能力支持本地使用
olly.bot是什么 Olly.bot是集成于iMessage和SMS的个人AI助手,基于OpenAI大模型,提供网络搜索、文档分析、图片生成等功能。Olly.bot无…
AdaCache – Meta推出加速AI视频实时高质量生成的开源项目
AdaCache是什么 AdaCache(Adaptive Caching)是Meta推出的开源技术,能加速AI视频生成过程。AdaCache自适应缓存机制优化计算资源分…
CogVideoX v1.5 – 智谱最新开源的AI视频生成模型
CogVideoX v1.5是什么 CogVideoX v1.5是智谱最新开源的AI视频生成模型。模型包含CogVideoX v1.5-5B和CogVideoX v1.5…
MiLoRA – 上海财经、南方科技和清华大学联合推出针对LLMs的微调方法
MiLoRA是什么 MiLoRA是参数高效的大型语言模型(LLMs)微调方法,通过更新权重分量来矩阵的次要奇异减少计算和内存成本。方法基于奇异值分解(SVD)将权重矩阵分…
OpenCoder – 无限光年联合多所高校推出的开源代码大型语言模型
OpenCoder是什么 OpenCoder是墨尔本大学、复旦大学等高校研究人员联合无限光年推出的开源代码大型语言模型(LLM),能提升开源代码LLM的性能至专有模型水平…
Infinity-MM – 智源推出的千万级多模态指令数据集
Infinity-MM是什么 Infinity-MM是智源研究院推出的千万级多模态指令数据集,包含4300万条样本,数据量达10TB。数据集经过质量过滤和去重,确保高质量…
FabricDiffusion – 谷歌联合卡内基梅隆大学推出的高保真度3D服装生成技术
FabricDiffusion是什么 FabricDiffusion是谷歌和卡内基梅隆大学共同推出的高保真度3D服装生成技术,能将现实世界中2D服装图像的纹理和印花高质量…
HourVideo – 李飞飞和吴佳俊团队推出的长视频理解基准数据集
HourVideo是什么 HourVideo是斯坦福大学李飞飞和吴佳俊团队推出的长视频理解基准数据集,包含500个第一人称视角视频,时长20至120分钟,覆盖77种日常活…
App Intents – 苹果推出的集成Siri和Apple Intelligence新框架
App Intents是什么 App Intents是苹果推出的支持开发者在iOS、macOS等平台上集成Siri和Apple Intelligence的新框架,实现应用…
DimensionX – 港科大、清华和生数科技共同推出的单图像生成复杂3D、4D场景框架
DimensionX是什么 DimensionX是香港科技大学、清华大学和生数科技共同推出的框架,能从单张图片生成高逼真度的3D和4D场景,基于视频扩散技术实现对空间和时…
SeedEdit – 字节豆包团队推出的AI图像编辑模型
SeedEdit是什么 SeedEdit是字节跳动豆包大模型团队推出的通用图像编辑模型,基于简单的自然语言指令编辑图像,包括修图、换装、美化、风格转换及在指定区域添加或删…
HK-O1aw – HKGAI团队联合北大团队推出的慢思考范式法律推理大模型
HK-O1aw是什么 HK-O1aw是香港生成式AI研发中心(HKGAI)旗下AI for Reasoning团队(HKAIR)与北京大学对齐团队(PKU-Alignme…
