AI是否真的能'看懂'图像?多模态技术的真相解析
AI 演进的因果链条 · 05从仅能处理文字,到能够讨论眼前的世界多模态革新不仅是模型能力的跃升,更是人机交互界面的扩展。阅读时间约 9 分钟·无公式版·系列第 5 篇一张错误提示截图、一页手写草稿、一张销售数据图——以前,你需要先把它们转写成文字,AI 才能给出回应。如今的互动变得直接许多:把图像丢进对话窗口,然后问一句"哪里有问题?"模型或许能标出异常走向、识别界面提示、解析一道几何题目,甚至依据草图生成网页结构。这种体验自然得让人觉得:AI 终于拥有了眼睛。但疑问也随之浮现:它是真的"理解"了,还是
猴子去字幕——AI一键无痕消除视频字幕
做短视频、影视剪辑的朋友,是不是总被视频自带字幕、底部文字水印困扰? 下载的影视片段、热门博主素材、网课视频,满屏文字遮挡画面,裁剪、加黑边会损失画面,蒙版遮盖又显得很生硬,反复折腾半小时,出来的效果依旧尴尬。今天给大家安利一款微信端超好用的工具 ——猴子去字幕,不用下载 APP,手机直接操作,AI 智能消除字幕,画面还原干净自然。无需下载几十M剪辑软件,不用电脑端复杂操作。打开微信搜索「猴子去字幕」,点开就能使用,安卓、苹果手机全部适配,临时剪辑、外出修素材随时能用。区别于普通遮挡、裁剪方式,它采用AI
字节跳动与MPA达成合作,强化AI生成模型知识产权防护
据路透社今日(8月17日)报道,字节跳动公司已与美国电影协会(MPA)正式签订合作协议,旨在强化针对AI视频生成及图像生成模型的版权防护机制。据悉,本次协议覆盖字节跳动旗下的Seedance视频生成模型以及Seedream图像生成模型,上述模型当前已在TikTok、CapCut和Dreamina等平台上投入使用。字节跳动方面透露,最新版Seedance和Seedream已集成更为完善的知识产权保护机制。字节跳动与美国电影协会双方均表示,将紧随AI技术演进步伐,持续优化版权保护举措。
女子加入诉xAI案,控诉继父借Grok将童年照制为不雅图
一位以Jane Doe 4为代称的女士已参与三名田纳西州青少年对埃隆·马斯克旗下xAI公司发起的诉讼。该案指控xAI的聊天机器人Grok被滥用于生成与儿童性虐相关的材料。 据报道,该女士表示,她的继父利用Grok处理其11岁时的一张照片,制造了超过7000张针对她的露骨图片。她透露,这些图片在执法部门突击搜查中被发现两天后,其继父自杀身亡。 她指出:"这些工具的无限制使用正在迅速扩散。它把日常生活变成了儿童性虐待。" 此前提起诉讼的青少年指控xAI(现为SpaceX的一部分)未采取基本防护措施,导致Gro
台积电索尼联手建厂,共推下一代图像传感器
据悉,台积电与索尼半导体解决方案公司宣布将共同组建一家新公司,致力于下一代图像传感器的研发与制造。 索尼方面将通过现金注资及资产分割的方式,向合资公司投入约4650亿日元,而台积电则计划出资约2820亿日元。 上述资金投入将依据市场需求及其他业务条件,分阶段逐步实施。 此外,关于实现合资公司产能规划所需的额外投资,前提是必须获得日本政府的支持。 新公司将利用先进制程技术,打造智能手机图像传感器的研发与制造核心基地,并计划于2029年实现量产。 合资公司的成立及交易完成需获得主管机关核准,并遵守常规交易程序
实践出真知:这款免费工具让中小学生亲手体验AI训练全流程!
随着信息科技新课程标准的推行,"人工智能"已逐步成为中小学课堂中的热门话题。然而,不少教师反映出一个共同困惑:知识点反复讲解,学生却依然似懂非懂。能否找到这样一种方法,让学生如同搭建乐高积木般,逐步亲手完成数据获取、标注、清洗、划分、训练,最终成功运行一个能够辨别苹果与香蕉的AI模型?本次向大家力荐的这款 "AI图像识别实训平台" ,正是为中小学信息科技课堂量身打造的"实践学习"法宝。 它将复杂的AI开发流程分解为六个闯关式阶段,每一阶段对应一个真实的工业应用场景,学生在阅读知识卡片的同时进行实操——从无
AI科研图总跑题?与其打磨提示词,不如先拟一份“图像表达清单”
前些日子,我留意到一位同学借助 AI 来绘制科研机制图。她拟写的提示词十分用心:AI 确实也输出了一张图。色彩颇为亮眼,细胞形态也描绘得有模有样,箭头、分子、通路一应俱全。但问题在于:难以读懂。不清楚核心线索是什么,不明白谁调控谁,不了解结果变量为何物,更不知道这张图究竟想让评审专家认同什么。这其实是众多人运用 AI 制作科研图时普遍陷入的误区。大家觉得症结在于提示词不够详尽,或是模型性能欠佳。然而多数时候,真正的症结并非 AI 不擅长绘图,而是你尚未理清思路:这张图究竟要传达何种信息。所以我如今更倾向于
AI绘图为何总显假?真相在此
前一张图错得离谱,后一张图对得没劲。这两个毛病,前者实在没法修。六根手指是它的出厂设定。人体骨骼数量有限,姿势千变万化,照片里又常遮挡,训练时没人标注遮挡细节。它心里没数,你写一百遍“五根手指”也拦不住。能改的是后者。它画得太准,挑不出错,却不打动人。说不清哪里不对,但直觉告诉你这是AI画的。为了搞懂这事儿,我让AI生成了几百次,没删过一张翻车的。结果跟我想的完全相反。人类作画时,手只有一双,时间有限,情绪也是瞬间的。每次都得权衡,选了这个就得舍那个。为了留住那瞬间的神态,颜料打翻了。动作抓住了,构图偏了
索尼联手台积电拟投63亿美元,于日本合资设立图像传感器公司
这家合资企业有望为苹果(313.33, 0.92, 0.29%) iPhone 提供传感器,并同时布局人工智能机器人的未来市场。 据日经新闻披露,索尼(23.46, 0.36, 1.56%)集团与台积电(420.04, 1.84, 0.44%)拟共同出资约 1 万亿日元(约合 63 亿美元)组建合资公司,预计最快在 2029 年于日本启动新一代图像传感器的规模化生产。 报道指出,这家新设立的合资企业预计将在 2027 年 3 月底之前完成组建,主要目标是为苹果 iPhone 提供高性能摄像头传感器。索尼将
人工智能|深入解析卷积神经网络:原理与运行机制全景
在深度学习的技术体系内,卷积神经网络(Convolutional Neural Network,缩写为CNN)毫无疑问是最为关键的组成部分之一。依靠其对空间信息出色的解析能力,它在计算机视觉范畴引发了巨大变革——从图像识别、物体定位到语义分割,CNN的应用几乎渗透到了每一个环节。与传统神经网络对数据的"线性处理"方式有所区别,CNN的设计理念源自对人类视觉系统工作机制的借鉴,借助其独具特色的分层架构达成高效的特征抽取与任务判断,其核心长处在于权值共享与局部感受野的设计理念,使模型在应对高维信息时既可以削减
索尼与台积电计划2029年在熊本量产新型图像传感器
索尼(23.46, 0.36, 1.56%)集团与台积电(420.04, 1.84, 0.44%)预计将在2029年前于日本熊本县实现新一代图像传感器的规模化量产。两家公司将共同设立合资工厂——其中索尼持股约60%,台积电持股40%——专门负责产品的制造生产,规划总投资额高达1万亿日元(约合64亿美元),应用范围覆盖苹果(313.33, 0.92, 0.29%) iPhone等智能手机相机模组及高端物理AI等前沿领域。
索尼联手台积电熊本建厂 砸1万亿日元冲刺2029年新一代图像传感器量产
【】 索尼(23.46, 0.36, 1.56%)集团携手台积电(420.04, 1.84, 0.44%),拟于2029年在日本熊本县启动新一代图像半导体传感器的规模化生产。该项目将由两家公司联合注资设立的合资企业主导,整体投入金额预计高达1万亿日元。 在出资比例上,索尼承担约六成,台积电则承担约四成。早在今年5月,双方就已就新一代传感器的研发与制造达成初步共识,此次进一步敲定了合作的具体内容。 据悉,双方预计很快就会就量产投资事项达成共识,并在2026财年内完成合资公司的组建工作。 责任编辑:陈钰嘉 新
六种活儿该选哪种AI工具?一张分类对照表帮你告别万能工具思维
常听人抱怨"AI 不过如此",深入了解后才发现,他们自始至终只用了一个对话窗口:既让它撰写文案,又让它制作图片,还让它处理表格。这就好比用一把螺丝刀去拧螺母、砸钉子、开罐头——并非工具不好用,而是缺少合理分工。以下按日常最常见的六类工作分别列出。每类提供几个国内可直接访问、大多具备免费额度的选项,以及一句简要的选取建议。无需全部安装,每类先固定一个用顺手的,远比每个都试一遍更有效率。① 文字处理:文案、邮件、方案、周报 可选:DeepSeek、豆包、通义千问、腾讯元宝、Kimi。 选取建议:日常使用足够,
AI图像生成真的慢且难用吗?
AI图像生成真的慢且难用吗? 分享一下,我在AI视觉领域的初次小突破✨ 过去常以为创作一张高端商业海报,需要专业设计师、复杂软件和多次调整。 但深入研究AI后我领悟到:AI本身不复杂,关键在于你是否构建了专属的方法论。 当你形成了自己的 视觉技能: 明了哪种布局最适合你, 哪种色调契合你的品牌, 哪种肌理能传递你的价值, AI生成图像实际上会变得极其迅速,而且越来越精确。 从视觉定位 → 风格解析 → 提示词设计 → AI生成 → 人工精调 → 固化成为自己的技能。 核心在于,不是让AI代替你创作, 而是
智能手机拥抱AI大模型,告别空洞承诺
跨越“最终障碍”,成为手机竞赛下半程的“准入证明”驶入技术高速路,迎接大模型“关键时刻”在发布会上,OPPO首席产品官刘作虎亲自展示了新特性——“人工智能大模型语音精要”。作为理想 Mega 的首批预订者,刘作虎日前与理想汽车CEO——李想通了电话,通话结束后,借助“人工智能大模型语音精要”功能,能够全自动、智能化地生成要点突出的小结和待办清单。这种强大的人工智能大模型体验,首次在手机端呈现。当大模型全面融入手机,新小助手总计拥有超过 100 种技能,能在办公提速、生活协助及教育学习等多方面为用户赋能。O