前Tesla Autopilot负责人、OpenAI联合创始人Andrej Karpathy在社交平台分享了Claude Opus 5的编程实测结果,引发近300万人围观讨论。实测中,Claude Opus 5在两小时内完成5500行代码编写,展现出接近专业程序员水平的编程能力。

Karpathy在实测中让Claude Opus 5独立完成一个完整的游戏项目。该模型不仅编写了5500行代码,还实现了游戏的核心逻辑和界面。然而有趣的是,Karpathy发现Claude Opus 5编写的游戏自身无法玩通关,暴露了复杂任务理解的局限性。
一、Frontier-Bench编程测试
Claude Opus 5在Frontier-Bench编程测试中表现优异。该测试考察模型能否在命令行中独立完成一整套编程任务,包括需求分析、代码编写、测试运行等环节。Claude Opus 5展现出强大的系统级任务处理能力。
在Cursor开发工具中,Karpathy同时开启多个子Agent,每个Agent独立运行不同项目。通过设置独立端口和项目目录,实现了无人工干预的并行开发。这种多Agent并行模式显著提升了开发效率。
值得关注的是,Karpathy此前总结了大语言模型编程的三大毛病:瞎假设不求证、过度工程、误伤友军。针对这些问题,他提出四条规则并写入CLAUDE.md配置文件:Think Before Coding、Simplicity First、Surgical Changes和Goal-Driven Execution。
二、Karpathy Skills规则优化
通过CLAUDE.md配置文件注入Karpathy提出的四条规则,Claude Opus 5的编程错误率显著降低。实测数据显示,错误率从41%降至11%甚至更低。这种规则引导机制为AI编程提供了新的优化方向。
Karpathy Skills的核心思想是:先陈述假设和歧义,不确定就问,不默默猜测;最小代码解决问题,不添加未要求的抽象或"灵活性";只改任务相关代码,不重构没有问题的部分;给出成功标准,而非步骤式命令。
社区项目andrej-karpathy-skills已将这些规则整理成可一键安装的配置模板。开发者可通过Claude Code插件或全局配置文件应用这些规则,显著提升AI编程的准确性和效率。
三、AI编程进入新阶段
Karpathy的实测结果引发行业对AI编程能力的热烈讨论。一方面,Claude Opus 5在两小时内完成5500行代码,展现出惊人的编程速度;另一方面,游戏无法通关的问题暴露了复杂任务理解的不足。
这种矛盾恰恰反映了当前AI编程的现状:AI已经能够快速生成大量代码,但在深度理解和全局把控方面仍有局限。Karpathy的规则优化提供了一种可行的改进路径。
对于开发者而言,Claude Opus 5的远程操控、协作和定时任务能力也值得关注。这种"数字劳动力"模式为企业提供了新的自动化解决方案,AI可在用户离线时代为处理工作。


