标签
WAIC现场:虎牙VAM1.0数字人惊艳亮相,真假难辨引围观

WAIC现场:虎牙VAM1.0数字人惊艳亮相,真假难辨引围观

专题:2026世界人工智能大会(WAIC) 新浪科技讯 7月18日上午消息,7月17日至20日,2026世界人工智能大会暨人工智能全球治理高级别会议在上海举行。 今日,腾讯AI应用创新论坛举行。现场,虎牙CEO黄俊洪带来了基于DiT架构的实时多模态数字人(12.960, 0.72, 5.88%)基础模型“虎牙VAM 1.0”。 在演示环节,该模型自动生成了多个数字人主播,从声音到微表情与真人高度相似,让观众均感到“非常逼真”。 据悉,该模型能够通过单张照片生成可说话、歌唱及舞蹈的AI数字人,并支持实时互动

2026-07-18 13:35:10  |  13 阅读

京东开源智能AI“眼睛”:能自主观察视频并主动反馈

你是否经历过这样的场景——锅里水沸腾了,双手忙不过来;直播中精彩瞬间转瞬即逝,还没来得及喊"回放";孩子在客厅蹦蹦跳跳,你的视线才离开几秒钟……此时你大概会想:要是 AI 能够自己盯着画面、自己拿捏时机、主动开口提醒,那该多省心。问题在于,目前几乎所有 AI 都停留在"被动响应"的阶段。即便开启了视频通话功能,也是你问它才答,你不开口它就沉默不语。豆包如此,Gemini 也如此。然而京东最近开源的一款 AI 模型,彻底颠覆了这一固有逻辑。先抓住核心信息:6 月 20 日前后

2026-06-17 11:25:45  |  11 阅读

百度一镜携手可口可乐推出范志毅AI数字人,全天候陪看世界杯赛事

新浪科技讯 6月12日下午消息,世界杯揭幕当日,百度一镜与可口可乐联手推出体育赛事互动AI数字人——范志毅实时互动数字人,继罗永浩数字人之后,百度数字人IP商业化再获突破性进展。 该数字人运用百度一镜实时交互技术,响应延迟控制在2秒内,高度还原范志毅的声音特征、表达习惯、神情举止,并保留其专业足球评论能力与独特个人风格。用户可通过语音、文字两种方式自由交互,产品具备情绪识别、即时对话等拟人化体验,同时配备实时场景切换、品牌互动展示等趣味功能,实现全天候在线陪看陪聊观赛服务。 目前,该数字人已在可口可乐中国

2026-06-12 21:20:34  |  9 阅读

谷歌发布超高速AI模型,284.2 token/秒刷新响应速度纪录

2026年5月23日 · AI大模型 · 人工智能AI研究社Google I/O 2026刚结束,谷歌就一口气发布了三个新模型,没有预热,没有分阶段推送,直接全部亮相。最引人注目的是Gemini 3.5 Flash,推理速度达到284.2 token/秒,这个数字比GPT-5.5快了4倍。速度这个东西,说出来可能没感觉,但实际用起来差别很大。你问它一个问题,284 token/秒意味着几乎感觉不到延迟,就像跟人聊天一样顺畅。更重要的是,Flash定位高并发、低成本实时交互,这不是为了跑分好看,而是真的要把

2026-05-23 20:22:27  |  20 阅读

AI陪伴的新时代:能主动中断你的AI才是真正的陪伴

Thinking Machines Lab 推出的新型模型,标志着AI从被动应答向主动共存的重大转变。先说结论未来真正能留在用户身边的AI,不仅仅是回答问题,而是能够感知、观察、记忆,并在恰当的时机主动介入。胡楠楠 · AI 陪伴硬件观察这篇文章旨在阐明三个核心问题:01Thinking Machines 的新模型为何超越了传统语音助手的范畴。02AI 陪伴硬件为何需要实时、多模态、可中断的交互模式。03Her + Jarvis 模式为何将成为下一代陪伴硬件的产品标杆。近日,我注意到 Thinking M

2026-05-16 11:10:18  |  17 阅读

实时交互AI时代来临:前OpenAI CTO重塑人机对话方式

你是否曾有过这样的经历——与AI对话时,你说完一句话,它需要"思考"好几秒才能噼里啪啦回一大段。想中途插话?抱歉,它听不见。想补充信息?等它讲完再开口。这感觉就像在用对讲机跟一个天才沟通——你按住说话,松开等待;对方按住说话,松开等待。明明已经2026年了,人类与AI的互动方式竟然还停留在"回合制"阶段。直到昨天,一家沉寂了18个月的公司,终于亮出了底牌。5月11日,Thinking Machines Lab(以下简称TML)发布了公司成立以来的首款模型——TML-Interaction-Small。这家

2026-05-13 12:08:25  |  23 阅读

OpenAI震撼发布!三款语音模型开启AI实时交互新时代,设计师必备技能解析

2026年5月8日,OpenAI未做任何预告,一次性推出了三款实时语音处理模型。这一次,AI终于实现了"边听边想边执行"的能力。2026年5月8日凌晨,OpenAI官方未提前透露任何消息,直接宣布了一项足以重塑行业格局的重大更新。三款创新型实时语音模型同步登场:官方明确定义:这是OpenAI有史以来开发的最为智能的语音系统,也是首次将GPT-5等级的深度思考能力,全面整合进实时语音对话环境中。为何称之为语音AI的"革命性突破时刻"?在此之前的所有AI语音系统,本质上都只是&

2026-05-09 08:50:42  |  22 阅读

AI行业快讯:2026年5月8日版

📝 摘要 本日人工智能圈核心动态汇总:OpenAI推出三款语音模型、国产AI芯片达成亚洲首例8nm eMRAM流片、昆仑芯开启科创板IPO辅导、DeepSeek V4突破海外围堵等8条重点 🌍 国际动态 【OpenAI接连推出三款语音模型,AI"开口说话"】 5月8日,OpenAI官方上线GPT-Realtime-2、GPT-Realtime-Translate及GPT-Realtime-Whisper三款音频模型,全方位增强AI实时听觉、口语交流、翻译及转录功能。GPT-Realtime

2026-05-08 20:08:27  |  35 阅读

OpenAI发布三大语音新模型,升级实时人机交互体验

OpenAI于本周四正式宣布,其API接口新增多项语音智能功能。旨在赋能开发者构建应用,达成与用户的语音交流、语音转文字及即时对话翻译。全新的GPT-Realtime-2作为新一代语音模型,能产出极度逼真的人声,达成顺畅的人机即时对话。对比前代GPT-Realtime-1.5,此模型拥有GPT-5层级的推理水准,能处理用户更繁杂的指令与需求。OpenAI同时发布了GPT-Realtime-Translate即时翻译模型。该模型能紧贴对话步调,提供同步的会话翻译服务。涵盖超过70种输入识别语言及13种语音输

2026-05-08 10:57:08  |  16 阅读
阿里巴巴ATH开放世界模型Happy Oyster全面开放体验

阿里巴巴ATH开放世界模型Happy Oyster全面开放体验

新浪科技讯 4月16日上午消息,名为Happy Oyster的产品于今日在X平台正式发布,宣布其开放世界模型产品面向用户开放早期体验通道。据官方介绍,Happy Oyster由阿里巴巴ATH团队精心研发,是一款支持实时创建与交互的开放式世界模型。用户现可通过官方网站happyoyster.cn提交体验申请。 这是阿里巴巴ATH在推出HappyHorse之后的又一重磅产品,标志着其业务布局从视频生成领域进一步拓展至交互式世界模型方向。 就在昨日,权威AI模型评测平台LM Arena发布了最新Video Ed

2026-04-16 12:49:38  |  9 阅读

6G有望让机器人动作更流畅:张平称通感融合将升级具身智能

当前,大模型与智能体加速从数字世界走向物理场景,但具身智能、机器人落地仍面临动作卡顿等“不丝滑”难题。未来随着6G技术商用,其将为具身智能带来哪些变革? 在3月27日召开的2026中关村论坛年会6G技术与产业创新论坛上,中关村泛联院理事长、北京邮电大学教授张平院士在接受新华网采访时表示,6G将通过通感一体化、意图传输与实时交互,破解当前瓶颈,推动人工智能真正扎根实体经济。 张平指出,当前人机物通信在计算控制闭环中,难以满足深层次、广范围的信息传递与协同控制需求。现有的具身智能、机器人之所以“不丝滑”,核心

2026-03-27 18:55:02  |  19 阅读