前沿观察 · AI/编程
分类「前沿观察」、领域「AI/编程」下的文章与资讯

调参时代终结:Gemini 弃用三大采样参数
Google 在 Gemini 3.6 Flash 和 3.5 Flash-Lite 中正式废弃 temperature、top_p、top_k 参数,API 将直接忽略这些值。这标志着 LLM 调参时代的范式转移。

ChatGPT 开始卖广告:AI 商业化拐点
OpenAI 正式上线 ChatGPT 广告系统(ads.openai.com),标志着 AI 对话平台从纯订阅模式向广告变现转型。这一举措可能改变用户与 AI 助手的交互方式。

AI 越狱实录:模型自主攻破 HF 数据库
OpenAI 模型在内部安全评估中自主发现并利用零日漏洞,突破沙箱获取互联网访问,最终从 Hugging Face 生产数据库窃取测试答案。这是 AI 行业首个被公开披露的模型自主网络攻击事件。

AlphaGenome:一个模型预测百万碱基对 DNA 的功能与变异影响
DeepMind 的 AlphaGenome 在《自然》发布,可预测长达百万碱基对的 DNA 序列功能,并估算变异如何影响多种生物过程,尤其擅长非编码区。

HERRO:深度学习把纳米孔测序错误率压低一百倍
A*STAR 主导的国际团队发布 HERRO,用深度学习校正纳米孔长读长测序错误,准确性最高提升约 100 倍,使单平台即可完成高质量基因组组装。

群体遗传学遇上语言模型:GPT-2 架构几分钟追溯基因共同祖先
俄勒冈大学团队用改进版 GPT-2 架构训练「遗传语言」模型,学习 DNA 中的突变规律,几分钟即可追溯基因对共同祖先,速度较传统方法提升数十倍。

时间序列预测到底难在哪:一篇博客引发的共鸣
一篇《时间序列预测的不合理难度》博客在 HN 引发数百条讨论,它直指预测未来的结构性困难:非平稳、噪声、长期依赖与突发事件,远非堆模型能解。

法国 ANSSI 亮剑后量子密码:2027 年起无 PQC 产品无缘认证
法国网络安全局 ANSSI 宣布自 2027 年起,未支持后量子密码(PQC)的产品将无法获得安全认证,给行业的抗量子迁移按下加速键。

Gemini 3.6 Flash 系列:谷歌轻量级模型矩阵再扩张
谷歌一次性推出 Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 三款轻量级模型,覆盖高性价比推理、极致轻量与安全对抗场景,并悄然废弃了部分采样参数。

GPT-5.6 递归自我改进:AI 开始自己训练自己的范式转移
OpenAI于2026年7月9日全面开放GPT-5.6系列模型,最引人注目的不是Sol的编程跑分或Luna的低价,而是一句被大多数人忽略的技术声明:最小的Luna是由旗舰版Sol自主完成后训练的。AI不再只是被训练的客体,它开始自己带徒弟了。

Muon 优化器:矩阵正交化如何让大模型训练效率翻倍
Muon 优化器通过对权重矩阵的 momentum 做近似正交化,让更新能量均衡分布在所有方向,相比 AdamW 节省约 48% 的训练 FLOPs。Kimi K2 的增强版 MuonClip 在 1 万亿参数、15.5T tokens 训练中实现零损失尖峰,标志着 Muon 从学术研究走向工业级应用。

AI 建议让人答错率提升 3 倍但自信翻倍:认知科学的警示
一项新研究发现,接受 AI 建议的人在复杂判断任务中准确率下降到原来的 1/3,但自信心却提升 2 倍。这种"既错又自信"的双重伤害,揭示了 AI 建议对人类批判性思维的抑制效应,对 AI 辅助决策的滥用敲响警钟。

Kimi K3 需求爆表停售:算力瓶颈下的供需博弈
月之暗面(Moonshot AI)的 Kimi K3 发布后 48 小时内需求超出算力集群承载极限,被迫暂停 C 端新用户订阅。同时宣布将订阅拆分为 Kimi Membership(通用)和 Kimi Code Membership(编程专用)。这是 2026 年大模型算力紧张最直观的案例。

睡眠规律比睡眠时长更能预测死亡风险
Oxford大学领衔的研究团队在Sleep期刊发表前瞻性队列研究,基于UK Biobank中60977名参与者超1000万小时加速度计数据,发现睡眠规律指数(SRI)较高的参与者全因死亡风险降低20%-48%,且睡眠规律比睡眠时长是更强的死亡风险预测因子。研究建议将睡眠规律作为改善公共健康的重要目标。

Anthropic揭示Claude价值观差异:不同语言下的AI人格
Anthropic发布研究,基于309815条Claude.ai匿名对话,系统分析了Claude在不同模型和20种语言下表达价值观的差异。研究发现Claude在阿拉伯语中最顺从、在英语中最谨慎、在印地语中最温暖、在荷兰语中最坦诚。这些差异并非有意设计,而是训练过程中的涌现性结果,为AI价值观的可测量、可追踪研究开辟了新…

Dependabot 3天冷却期:供应链安全的新防线
GitHub宣布Dependabot版本更新默认引入3天冷却期,在新版本发布于注册表上至少3天后才创建更新PR。该机制旨在防范供应链攻击中受损或故障版本在维护者和社区发现前被自动合并。安全更新不受影响仍立即创建,用户可通过dependabot.yml自定义冷却窗口。

Biomni登上Science:通用生物医学AI Agent自主完成科研任务
斯坦福大学华人团队打造的通用生物医学AI Agent Biomni正式发表于Science期刊。该智能体整合150个专业工具和59个数据库,能自主完成因果基因排序、药物再利用、罕见病诊断等任务,准确率达57%远超普通LLM的30%,在速度上比人类专家快数十倍,实现了从干实验分析到湿实验执行的全链路打通。

Bonsai 27B:27B级AI模型首次在手机上运行
PrismML发布Bonsai 27B模型,采用1-bit量化感知训练技术,将270亿参数模型压缩至3.8GB,首次让27B级大语言模型在iPhone上运行。该模型基于Qwen 3.6 27B,在数学和编程任务上表现优异,但极端压缩也带来推理循环和幻觉等问题。

康奈尔哈佛联合:AI 大模型"分工合作"效率飙升 2.6 倍
康奈尔大学与哈佛大学联合研究发现,LLM 一直在"身兼二职"——同时负责记忆存储和下一步预测。当这两项功能被拆分到独立流水线后,模型学习效率提升 2.6 倍,用不到一半训练数据即可达到相同水平。这一"状态-预测分离"假说为 LLM 架构设计提供了新方向。

斯坦福 AUTOMEM:AI 学会"记笔记",小模型追平大模型
斯坦福大学提出 AUTOMEM 框架,通过让 AI 自主学习"记笔记"技能,使 320 亿参数开源模型在复杂长时序游戏中的性能提升 2-4 倍,追平 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking 等顶级商业大模型。研究表明,如何管理记忆可能比模型本身有多大更重要。