Skip to content

关于人工智能

Chatbot 到 Agent,改变了什么?

  1. Agent 让模型可以与环境交互,感知环境能力让用户减少了不必要的复制黏贴,模型可以自我检验与修正。
  2. Agent 让所有人为 AGI 贡献,Skills 本质是行动的方法论,Agent 读取 Skills 让模型解决特定问题的能力进一步提高。由于每个人都可以编写 Skills,这让非开发者也可以为人工智能发展做贡献。
  3. Agent 让模型具备了“认知执行”的闭环。通过规划、记忆与工具调用的循环,模型能够将模糊的长期目标拆解为具体的原子操作,实现从“生成答案”到“解决问题”的本质飞跃。

Agent 当前有什么问题?

  • Token 消耗量过大:重复迭代中带来了巨大的 Token 消耗。在某些长尾任务上,成本甚至可能超过人工处理。
  • 存在死循环问题:模型可能陷入循环调用,无法自主终止。
  • 寻找和调用 Skill 不准确:如果 Skill 不精心设计,Agent 可能不会触发调用;当已有本地 Skill 被指定时,可能无法寻找到本地 Skill 而改用下载策略(这可能由于网络下载 Skill 设计时优先级过高)。
  • 反馈不足:Agent 在运行过程中可能存在提前结束、卡死、死循环等情况,可能缺少交互反馈,影响用户体验。当使用子代理时,子代理内部推理链不可见,进一步导致用户“黑盒焦虑”。
  • 交互逻辑不足:当前主流应用不支持中途提示(动态插队)。当用户想要完善先前要求或发现并纠正执行错误时,必须停止先前对话并重头开始,缺乏像人类协作中的“实时纠偏”机制。
  • 文件管理不佳:Agent 对文件的管理缺少目录分类意识,容易在根目录或临时空间产生过多碎片化文件,且缺少统一的命名与归档规范,导致跨会话复用体验极差。

当前 AI 存在什么问题?

  • 美学理解困难:面对生成式任务,单纯的提示词不足以表达复杂场景且不同的厂商模型“审美偏好”不同,提示词复用能力弱。
  • 不必要思考:AI 可能存在不必要的重复思考或过度的自我纠错(尤其在推理模型中),这带来了更多的 Token 消耗。同时,面对用户对客观事物的质疑时,模型往往立场摇摆(过度迎合用户),缺乏基于事实的坚定性。
  • 信息滞后:预训练数据的截断日期导致信息滞后,这会带来错误判断(如过时的API调用)或不良实践(如引用已废弃的安全规范)。

当前 AI 训练存在什么问题?

  • 美学评估困难:美学不易评估,且存在强烈个体差异。当下可能更应该聚焦于多模态的美学理解(如构图语义、色彩心理学)而非粗暴的评分,未来 AI 很可能会通过非纯文本的个体数据(如眼动追踪、停留时长)理解个体审美偏好。
  • 迭代速度慢:AI 训练的迭代速度受到算力集群规模、数据清洗流水线和通信瓶颈(即训练基建)等决速步的限制,导致一次失败的实验可能浪费较长时间。

为什么 AI 编程值得期待?

  • 编程具有相当程度的输出的确定性(编译通过或报错、单元测试通过或失败),这极大方便了结果评估和自动化反馈。
  • 编程有较完善的环境用于训练,开源代码库和分析工具提供了大量评估环境。
  • 编程带来了计算的确定性,因为代码输出结果不基于概率采样,这使得结合形式化验证成为可能。
  • 这让 AI 进入了自我优化阶段,AI 能通过编程改进自己的推理框架。
  • 解决长尾任务。通过编程,AI 可以通过编程尝试解决特殊的场景任务,自动探索解决方案,应用不需要预置不必要的功能。

一些看法

  • 算力依旧重要,且重要性将提高,且推理算力优于训练算力。
  • 算力的不断进步可能推动计算机图形学进一步发展。
  • 具身智能在数据上存在巨大挑战,真实物理数据采集昂贵且危险,需要依赖仿真数据并实现部分产品(如扫地机器人、工业机械臂)的快速落地,以形成真实的物理交互数据飞轮。而仿真数据仍需要提高对真实世界模拟程度。
  • 多模态模型会带来 Agent 更多维度的进步,得益于模型感知环境的能力得到巨大提升。比如模型视觉让模型能够通过截屏来诊断前端样式问题。
  • 安全
    • 由于信息滞后和幻觉,Vibe Coding 代码可能存在意想不到的缺漏,可能带来更大的安全隐患。
    • 各类平台 Agent 功能的不断推出将让提示词注入有广泛的攻击面。
    • 为了让 Agent 能够安全运行,轻量且高性能的容器化技术可能尤为重要。
  • AI 让人的产出变多,反导致疲劳增加,且大量是虚假的生产力。