标签

AI拿下执医考试:看病能力靠不靠谱?

近日,一则消息在医疗圈引发热议——有一套AI系统首次通过了中国执业医师资格考试。据科技日报5月3日报道,该系统由国内团队研发,并在2026年度执业医师资格考试中取得合格成绩,这在全球范围内也被称为先例。想到这里,我不禁联想到2016年谷歌DeepMind的AlphaGo击败李世石:当时人们普遍认为围棋是人类的“最后堡垒”,结果不到一年就被AI突破。没想到十年之后,AI竟连医生的资格考核都通过了。不过我也想说明一句:能考过试不代表就能把病看得更好。我了解了一下,这套AI在临床诊断测试中的准确率达到92%,而

2026-05-04 06:44:04  |  29 阅读

AI急诊诊断更胜一筹?外刊研究解读

在线索不充分、决策时间又极其紧迫的急诊环境里,AI模型的诊断表现竟然能超过人类医生。一项研究显示:在急诊室的诊断任务中,某个AI模型的表现优于内科/临床医师。急诊诊断本就困难重重:信息量有限、可用时间也很短,但风险却异常高。比如,发热既可能只是季节性流感,也可能预示着危及生命的败血症。研究团队用医疗资料和既往病史对OpenAI模型进行测试:在67%的病例中,该模型给出了正确或接近正确的诊断;而医生的对应准确率为55%。《科学》报道称,未来10年内,AI智能体在急诊医学中很可能将变得常见,从而让决策更快、依

2026-05-03 22:22:46  |  23 阅读

哈佛研究揭秘:AI诊断真比医生强?真相并非如此简单

这两天看到一则新闻,真让我有点摸不着头脑。OpenAI的o1模型在哈佛的急诊测试中,诊断准确率达到了67%。而两位人类急诊医生的准确率,分别是55.3%和50%。AI比人类高出超过10个百分点。第一反应是兴奋,还是恐惧?说实话,两种感觉都有。兴奋的是AI的潜力,但恐惧的是媒体标题“AI打败医生”。这事儿没那么简单。所以我花了一整晚时间研究了原始论文、哈佛解读和各大媒体报道。结论可能跟你想象的不太一样。这件事到底发生了什么。首先,背景信息。这项研究由哈佛大学和Beth Israel Deaconess医学中

2026-05-03 18:29:41  |  12 阅读

急诊诊断新突破:OpenAI模型准确率超人类医生

哈佛医学院领衔的一项重磅研究,于 2026 年 4 月 30 日刊载于《Science》杂志,结论显示:OpenAI 的 o1-preview 推理模型在真实急诊场景下的诊断准确率,明显超越了人类医生。一、研究概览(权威、前沿)发布:Science(2026-04-30)机构:哈佛医学院、贝斯以色列女执事医学中心、斯坦福大学模型:OpenAI o1-preview(2024 年末推出,强推理大语言模型)对照组:2 位资深急诊主治医师(专家级别)样本:76 份波士顿医院真实急诊病历(纯文本:主诉、生命体征、

2026-05-02 10:43:49  |  16 阅读

OpenAI:评价体系成AI“胡编”诱因 | Nature

大语言模型常会输出自信且看似合理的谬误(即“幻觉”),这严重制约了模型的可靠性。尽管学界已提出多种解释及缓解手段,如检索增强、一致性自验证和基于人类反馈的强化学习等,但在最先进的模型中,这一问题依然难以根除。为何模型明明不懂,却总爱一本正经地胡乱作答?OpenAI近期在《Nature》发表文章,指出核心原因:问题并非仅限于模型能力不足或数据存在噪声,而是当前主流的训练目标(预测下一词)和评估方式(基于准确率),在无形中系统性鼓励了毫无根据的“瞎猜”。这可细分为两个层面:一是预训练阶段。只要核心目标仍是“预

2026-04-26 11:52:05  |  13 阅读

AI做PPT全攻略:认知、工具与实操

深夜里常有朋友咨询,如何制作PPT,以及借助AI生成演示文稿的技巧。"盛少,我刚用Gamma生成了路演稿,60秒搞定12页。设计感确实惊艳,可我花了俩小时调格式。导出的pptx里,字体全乱套了,间距也不对,图片也模糊。你说图啥呢?"这类反馈,几乎是我过去半年收到频率最高的问题集合。今天我就借此文,做个系统的梳理。"AI能否制作PPT"——这一问在2026年已无必要,全球AI演示文稿市场规模已超47亿美元,企业采纳率突破60%。症结在于:多数人使用AI做PPT的方式,从一开始

2026-04-25 23:22:33  |  45 阅读

AI大模型实现“肌肉记忆”:Token使用量降低超七成,决策更精准

编者按:AGI时代正加速来临,智能系统从“工具”向“伙伴”转变,同时带来了许多亟待解决的核心问题:如何保证智能系统安全、可信、可控?如何在智能体之间(A2A)建立安全可信的交易支付体系?如何持续提升模型Token效率,让模型又快又准,加速智能体规模化应用?又如何通过高质量数据不断优化大模型性能?面对这些关键挑战,蚂蚁数科将携手高校推出系列技术研究《In Tokens We Trust》,聚焦上述前沿议题,分享我们在探索中的思考与实践。今天带来专题的第二篇:蚂蚁数科与中国科学技术大学的联合研究成果:让AI大

2026-04-24 19:50:21  |  11 阅读

美中央司令部驳斥伊朗油轮绕过封锁

美国中央司令部驳斥了关于“Hero II”、“Hedy”和“Dorena”号船只绕过霍尔木兹海峡封锁的报道“不准确”。 中央司令部在X平台上发布了这一声明。 中央司令部指出,这些悬挂伊朗国旗的油轮目前停靠在恰巴哈尔港,此前曾在本周早些时候被美军拦截。此前试图突破封锁的‘Dorena’号目前由美国海军驱逐舰在印度洋护航。 中央司令部表示,截至目前,美军已命令29艘船只掉头或返回港口。

2026-04-23 04:26:13  |  16 阅读

AI辅助数仓开发的实践与思考

近期尝试运用Claude Code处理数仓项目中的各类任务,过程中涌现了许多感悟,特此记录。趁着思路尚清晰,决定将这段实操经历与思考整理成文,期望能为同样探索AI工具的朋友们提供些许参考。事实上,我使用AI辅助工具已有一段时间。起初和大多数人一样,仅通过聊天框提问寻找答案。但近期开始使用Claude Code后,我的工作模式发生了显著转变。Claude Code对整个工作流具备记忆功能,这与传统聊天框截然不同。传统对话框中的对话是割裂的——每次开启新会话,AI便如失忆般对过往讨论一无所知。而Claude

2026-04-20 02:04:48  |  17 阅读

AI辅助手术器械识别研究:IF 3.7的《多模态人工智能》应用

这是文献阅读选题思路的第202篇文章。该文献标题为《Use of Multimodal Artificial Intelligence in Surgical Instrument Recognition》/《多模态人工智能在手术器械识别中的应用》,发表于2025年的《Bioengineering》,影响因子为3.7。研究测试了ChatGPT-4、ChatGPT-4o、Gemini三种通用大模型以及专业软件SID 2.0对手术器械的识别能力。结果指出,ChatGPT-4o在器械大类识别上表现最佳(准确率8

2026-04-17 07:04:15  |  21 阅读

手机咳嗽声可辨7种肺病!瑞金医院AI模型准确率达96%

咳嗽,几乎是每个人都经历过的症状。感冒会咳,过敏会咳,慢阻肺、哮喘、支气管炎也会咳。但同样是咳嗽,不同疾病发出的“声音”其实存在微妙差异。过去,医生通过听诊器判断肺部问题,靠的是多年临床经验。如今,人工智能正在尝试“听懂”咳嗽背后的疾病信号。2026年2月,上海交通大学医学院附属瑞金医院瞿介明教授、周敏教授团队在国际知名学术期刊《npj Digital Medicine》(影响因子15.1,JCR Q1区)在线发表了一项重要研究成果“A device-invariant multi-modal learn

2026-04-16 21:10:34  |  30 阅读

AI医疗初具规模,部分疾病快速诊断,准确率超95%

AI医疗助手在特定领域已相当可靠,但目前无法完全取代人类医生的全面判断。目前,AI在分析医学影像、辅助诊断和数据处理方面表现出色,一些系统的准确率超过95%。甚至在复杂病例的初步诊断中,AI的准确率是人类医生的数倍。例如,浙江大学的AI病理助手能在1到3秒内锁定癌症病灶,准确率超过95%。然而,AI的可靠性受到输入信息完整性和临床推理能力的限制。哈佛医学院的最新研究表明,AI在“鉴别诊断”阶段表现不佳,超过80%的病例未能将正确的诊断列入初步名单。这意味着,当患者仅提供模糊症状时,AI很容易误诊,其建议只

2026-04-16 06:13:17  |  29 阅读

AI赋能眼科超声诊断|npj Digit. Med.(IF=15.1)浙大二院突破:病灶识别与报告生成一键搞定

研究速览眼科超声影像解析是视网膜脱离、玻璃体出血等眼底疾病诊断的核心环节,但长期以来需要资深专科医师亲自把关,不仅耗时而且对专业经验要求极高。随着超声检查数据呈爆发式增长,传统人工智能方案仅能完成疾病初筛,难以同步实现病灶精确定位与诊断报告自动撰写,临床应用价值受到明显制约。浙江大学医学院附属第二医院金凯研究团队携手多家医疗机构,在国际权威期刊《NPJ Digital Medicine》发布重磅成果,创新性地研发出视觉-语言分割模型——通过融合视觉-语言模型与Segment Anything Model技

2026-04-16 00:34:09  |  31 阅读

AI量化交易策略实践:多智能体协作如何优化决策精准度

单一模型在复杂多变的市场环境中,准确率往往难以突破70%。采用5至7个专业化AI智能体协同工作,可将决策准确率提升至78%至85%。我们通过三个实战案例验证了多智能体系统在不同市场条件下的稳定表现。相较于传统策略,多智能体系统初期投入增加约40%,但年化收益可提高60%以上。2025年8月,某私募基金的一套纯技术分析系统在比亚迪(002594)上遭遇挫折。系统监测到MACD金叉、RSI从超卖区反弹、成交量放大,所有技术指标均显示“强烈买入”信号。基金经理依据信号在230元价位建仓,三天后股价跌至212元,

2026-04-12 08:44:18  |  17 阅读

如何向AI提问才能避免被误导?

随着人工智能(AI)技术的飞速发展和普及,生成式AI应用层出不穷。无论是国内的元宝、豆包、DeepSeek,还是国外的ChatGPT、Google,都已深入人们的日常生活。对于经常出差或旅游的人来说,这些AI助手已成为不可或缺的出行顾问。正因为便捷,很多人习惯遇到出行、购物、生病或工作难题时,第一时间掏出手机求助AI。无论是制定旅行计划、预订酒店,还是撰写文案,AI都成了贴心的辅助工具。作为一名注重资源节约的环保主义者,我长期使用一部内存仅32G的旧手机。为了体验AI,我换了一部新手机,下载了豆包、元宝和

2026-04-12 06:15:47  |  18 阅读