-
Audiobox-Meta推出的新一代音频生成模型
Meta Audiobox是什么? Meta推出的新一代AI音频生成工具,用声音+文字指令就能定制各类音效、人声和环境音。比如录一段自己说话,输入“变成新闻主播腔调,背景加入雨声”,就能生成带场景的播报音频。2025年新增中文支持,个人创作者和影视团队都在用。 https://ai.meta.com/audiobox 核心功能:声音自由定制 1. 语音克隆+风格迁移 上传10秒人声样本→生成相同音… -
Seed-Coder:字节跳动最新推出的开源代码模型
Seed-Coder:字节跳动开源AI编程助手,用自然语言生成高质量代码,支持Python/Java/C++等多种语言。完全免费,提升开发效率,立即体验! -
Stable Virtual Camera:Stability AI等推出的AI模型 ,2D图像轻松转3D视频
✨ Stable Virtual Camera:让图片动起来的3D视频魔法 Stable Virtual Camera是Stability AI公司推出的一个AI视频生成模型,它能把普通的2D静态图片变成带有逼真3D效果和深度感的动态视频。你只需要提供一张或几张照片,它就能模拟出相机在不同角度移动的效果,生成看起来非常专业的3D视频。 官网地址:https://stable-virtual-cam… -
FLUX.1 Kontext:Stable Diffusion原班人马推出的开源AI图像生成模型
FLUX.1 Kontext:5秒精准修图,设计师的AI助手真的来了! FLUX.1是由Black Forest Labs推出的全新开源AI图像生成模型,Black Forest Labs由Stable Diffusion原班人马和多位Stability AI前研究员成立。FLUX.1 Kontext或许能终结这些烦恼。这款由Stable Diffusion原班人马打造的AI图像编辑模型,主打“文… -
HunyuanCustom:腾讯混元开源的多模态定制化视频生成工具
视频制作不用摄像机?腾讯混元HunyuanCustom:AI视频生成工具,输入文本/图片即可生成4K视频,解决身份漂移难题,保真度达92%。电商与教育创作者必备,提升10倍制作效率,立即体验高效视频创作。 -
GO-1:智元推出的首个通用具身基座模型
机器人看视频学技能?GO-1大模型通过观看人类视频让机器人快速掌握复杂操作,小样本泛化降低90%训练成本,一脑多形适配多种硬件。提升部署效率,立即了解突破性进展。 -
GLM-Realtime:智谱最新推出的端到端AI模型,支持2分钟记忆和清唱功能
GLM-Realtime:智谱AI端到端多模态模型,支持清唱与毫秒级响应,适配智能硬件/教育/医疗场景,经评测响应速度领先,提升实时交互体验。 -
Open-Sora: Colossal-AI开源的类Sora架构视频生成模型
开源视频生成革命 Open-Sora是由潞晨科技推出的开源视频生成模型,采用扩散Transformer架构,支持文本生成高清视频。最新2.0版本以20万美元低成本训练11B参数模型,性能逼近OpenAI Sora,支持720p/24fps视频生成,显著降低行业技术门槛。 官网与开源地址:https://github.com/hpcaitech/Open-Sora 核心架构与技术突破 1. 高效多模… -
京东言犀大模型
京东言犀大模型:产业智能化的新引擎 京东言犀大模型深度融合供应链与产业场景,专为零售、物流、金融等高知识密度领域打造。2025年升级至720B参数规模,新增多模态理解能力,强化对长文本、复杂逻辑任务的支撑,成为国内首个通过工信部“可信AI”认证的产业大模型。 官网直达:https://yanxi.jd.com 一、技术架构:全栈工具链支撑 1. 数据融合引擎 供应链知识增强:30%独家数据来自京东… -
讯飞星火开源大模型
讯飞星火开源大模型核心解析 讯飞星火开源大模型(iFlytekSpark-13B)是科大讯飞推出的130亿参数开源大语言模型,基于全国产化算力平台“飞星一号”训练,提供基础模型(iFlytekSpark-13B-base)和精调对话模型(iFlytekSpark-13B-chat),支持文本生成、代码编写、数学推理等通用任务,深度优化中文场景及行业应用。 访问官网:星火开源社区 核心能力与评测表现… -
Matrix-Game:昆仑万维开源的交互式世界基础模型
🚀 颠覆想象:Matrix-Game 2.0开启实时交互虚拟世界新纪元 昆仑万维在2025年8月发布的Matrix-Game 2.0,可不是个简单的模型升级,而是真正能“动起来”的开源交互式世界模型。它能以每秒25帧的速度实时生成分钟级的高连贯视频,让你用键盘鼠标就能自由操控虚拟世界,仿佛真的置身于一个物理规则运转正常的平行宇宙里。 官方资源一键直达:项目主页:https://matrix-gam… -
混元TurboS:腾讯混元推出的新一代快思考模型
AI响应太慢?腾讯混元TurboS:毫秒级推理引擎,首字延迟220ms,成本仅GPT-4-turbo的1/4。支持高并发处理,提升代码生成与智能客服效率。企业级应用首选,立即体验极致速度与性价比。 -
Gemini-谷歌发布的多模态AI大模型
谷歌Gemini多模态AI:全能模型矩阵覆盖全场景,跨模态理解生成能力领先,开发者低门槛接入,性能超越GPT-4o。不点就亏!掌握三大版本核心功能,解锁科研生活新可能。 -
Genesis:生成式物理引擎,一句话生成完整精确的模拟物理世界
Genesis生成式物理引擎:顶尖机构联研,支持多物理耦合仿真与语言驱动场景生成,单卡4300万帧/秒性能突破,适配科研级精度需求,经百度算法认证赋能工业机器人训练场景。 -
-
Hailuo 02:MiniMax最新推出的AI视频生成模型
🌊 Hailuo 02:一键生成高清视频的AI魔法师 Hailuo 02(海螺02)是上海人工智能企业MiniMax(稀宇科技)在2025年6月18日推出的新一代AI视频生成模型,被誉为"全球首个能生成体操等高度复杂场景的视频大模型"。它不仅能根据文字描述生成1080P高清视频,还能处理极端复杂的物理场景,让普通人也能轻松制作专业级视频内容,真正实现了"人人都是导演&… -
Gemma 3-谷歌发布的开源AI模型,小尺寸可商用
Gemma 3:谷歌开源多模态AI模型,支持128K长文本处理,适配PC/移动端,经LMArena评测STEM准确率提升35%,适合科研与多语言场景。 -
文心大模型X1:百度推出的新一代深度思考模型
🧠 文心大模型X1:百度出的“最强大脑”,中文AI终于站起来了! 想让AI帮你写报告、做分析、甚至生成短视频脚本?百度最新推出的文心大模型X1,可能就是你在找的“全能智能助手”。这不是普通的聊天机器人,而是专注复杂推理和多模态任务的高性能模型——它能理解128K超长文本,逻辑推理能力比前代提升32%,中文长文本理解甚至超越了DeepSeek-R1。 访问文心大模型官网 ✨ 核心功能:不只是聊天,更… -
ThinkSound – 阿里通义开源的AI音频生成模型
🔍 ThinkSound是什么? ThinkSound是阿里巴巴通义实验室在2025年7月正式开源的音频生成模型,它不仅是阿里在音频AI领域的一次重大突破,更是全球首个将思维链(CoT)技术应用于音频生成的开源模型。简单来说,它能让AI像专业音效师一样“看懂”画面内容,“理解”事件逻辑,并生成高度匹配、精准同步的高保真空间音频,彻底告别传统“看图配音”的机械感和错位尴尬。 ThinkSound的官… -
M2UGen-腾讯发布的多模态音乐生成模型
核心功能解析(2025最新版) 文字→音乐输入“赛博朋克雨夜”等描述,20秒生成带鼓点、合成器的电子乐,支持MP3/WAV格式下载。 图片→音乐上传风景照自动生成氛围音乐,山水图匹配古筝笛声,城市夜景触发电子律动。 视频→配乐分析视频内容生成适配BGM,如战斗场景生成急促鼓点,浪漫片段生成钢琴旋律。 智能音乐编辑一键移除人声、替换乐器(如吉他转琵琶)、调整节奏(80BPM→120BPM)。 官网体… -
dots.llm1:小红书开源的 MoE 架构大语言模型
✨ dots.llm1:小红书出品的高效AI语言模型 dots.llm1是小红书旗下人文智能实验室(hi lab) 在2025年6月开源的一款大型语言模型。它采用了先进的MoE(混合专家)架构,虽然模型总参数量高达1420亿,但在实际推理时每次只激活140亿参数。这种设计让它既能保持强大的性能,又显著降低了计算成本和响应时间,是一个非常“聪明”且“经济”的AI模型。 它基于11.2万亿高质量的真实… -
gpt-realtime – OpenAI最新推出的语音模型
OpenAI GPT-Realtime语音AI:实现自然实时对话,支持情感识别和多语言无缝切换。提升智能客服与语言学习体验,立即了解革命性语音技术。 -
Seaweed-APT:AI视频生成模型,单步生成2秒钟的1280×720 24fps视频
🚀 字节跳动Seaweed-APT:单步生成720P高清视频的AI黑科技 用AI生成视频就像拍照一样简单?字节跳动推出的Seaweed-APT模型让这成为现实。这个突破性AI视频生成工具,只需单次计算就能产出1280×720分辨率、24帧/秒的2秒高清视频,彻底改变了传统逐帧生成的繁琐流程,让影视制作、游戏开发和广告创意领域的动态内容创作变得前所未有的高效。 官网:https://seaweed-… -
CoDi-多模态 AI 大模型
🌈 CoDi是什么? CoDi(Composable Diffusion)是微软推出的跨模态生成模型黑科技,能像“AI魔术师”一样自由组合输入输出——你给它文字、图片、音频甚至视频中的任意组合,它就能生成同步对齐的多模态内容!比如输入一段海浪文字+钢琴曲片段,直接输出带海浪声的治愈系视频,彻底打破传统AI“单线程创作”的局限。 官网直达:https://codi-gen.github.io/ ✨ …
























