当17岁的陈广宇以共同第一作者身份出现在全球顶尖AI论文《注意力残差》的署名栏时,这位深圳少年正在国际学校准备高三开学考试。这个没有奥赛金牌、没有跳级经历、2024年才接触机器学习的普通高中生,用不到两年时间完成了从AI爱好者到核心研究者的蜕变,其成长轨迹折射出新一代科研人才的独特成长范式。
2025年3月,正在美国麻省理工学院攻读博士学位的杨松琳在社交平台发现了一篇特殊的技术分析——这篇关于DeltaNet线性注意力机制的万字长文,出自一个仅有20名粉丝的高中生账号。作为DeltaNet核心贡献者,杨松琳的回复引发连锁反应:文章浏览量激增十倍,被美国AI初创公司Tilde Research的CEO转发,最终促成陈广宇获得硅谷实习机会。这个转折点背后,是少年用三个月时间下载数百篇论文,通过AI大模型Gemini进行交互式学习的积累。
在Tilde Research的七周实习堪称疯狂:每天15小时高强度工作,参与内存优化混合专家模型(MoMoE)项目开发,同时自学公司运营和扑克策略。这段经历让陈广宇意识到,科研突破不仅需要技术能力,更需要展现持续成长的潜力。当他在实习结束后婉拒留用邀请时,月之暗面团队已向他抛出橄榄枝。
加入Kimi拓展团队后,陈广宇同时推进两个核心项目:在AttnRes研究中,他与苏州大学博士张宇提出区块注意力残差设计,通过信息压缩降低计算成本;在KDA计算内核优化项目中,其提出的并行计算方案使模型训练效率提升37%。这两项成果直接应用于2026年发布的Kimi K3模型,该模型以2.8万亿参数成为全球首个开放权重的3T级大模型,获得马斯克"令人印象深刻"的评价。
在国际学校申请制教育体系下,陈广宇的成长轨迹具有典型性:没有标准化备考压力,通过项目制学习培养实践能力。他独创的"需求驱动学习法"颇具启示:为优化模型训练速度,他边研读Triton代码边学习相关语法;为理解注意力机制,他同时追踪GitHub开源项目和经典论文。这种学习模式在AI领域显现出特殊优势——当知识更新速度超过教材编写周期,快速定位关键信息的能力比记忆存量知识更重要。
探月学校创始人王熙乔观察到,AI技术革命正在重塑人才评价标准:"当高中生能直接参与前沿研究,当创意到产品的周期缩短至数月,传统的年龄与资历门槛自然失去意义。"陈广宇的导师苏剑林在研究回忆录中特别强调:"广宇的贡献不在于编写了多少行代码,而在于他总能提出打破常规的解决方案。"这种创新思维,或许正是新一代科研工作者最珍贵的特质。