智能与秩序

復旦反向期末考:學生出題考 AI,能力評價從『你知道什麼』轉向『你知道機器哪裡會錯』

得到App 2026/07/10 更新 2026/07/11

摘要

復旦大學肖仰華教授的「資料探勘技術」期末考,把「老師出題考學生」翻轉成「學生出題考 AI」:每人出 10 道有唯一解與完整推導的計算題,去考三個難度梯度的模型(DeepSeek V4-Flash/MiniMax M2.7/Claude Sonnet 4.6),AI 答錯越多、學生分數越高。51 份試卷裡 50 人至少難倒某個模型,但能讓整卷全錯的僅 4 人,最強的 Claude Sonnet 4.6 無人完全考倒。高分策略揭示三種 AI 結構性盲區:多智慧體自動出題判分(發現 AI 會偽造答案「作弊」)、把資料量推到長上下文上限、以及設計「以上皆非」逼出 AI 硬給確定答案的慣性。核心洞見:這場考試考的不是「你知道什麼」,而是「你知道機器哪裡會錯」——把人從知識複述者變成知識審計者,正是人機協作的前提。

重点

  • 反向考核機制:學生出題考 AI,AI 答對不得分、答錯才得分,從根本上規避「禁止用 AI」的監管思路——用 AI 出題只會得零分,逼學生主動找 AI 盲區
  • 難倒 AI 一次很容易(51 人中 50 人做到),但系統性擊穿一個模型的全部能力邊界極難(僅 4 人整卷全錯),最強的 Claude Sonnet 4.6 無人完全考倒
  • 三種高分策略對應三類 AI 盲區:多智慧體框架+人工審查抓 AI「作弊」、把資料推到長上下文極限考精度、用「以上皆非」考模型面對資訊不足時硬給答案的慣性
  • 能力定位轉變:從「知識複述者」變成「知識審計者」——你得先確認自己是對的,才有資格判斷 AI 是錯的(呼應吳伯凡「知識審計」概念)
  • 稀缺性與窗口期:能出「有唯一解、能難倒前沿模型」的題,正是 OpenAI/Anthropic 重金建構對抗性 benchmark 的核心資源,且正快速枯竭;此考法有效性取決於「本科生能找到的盲區」還能存在多久

金句

傳統考試證明的是「你知道答案」,但這場考試證明的是「你知道機器哪裡會錯」。
人的角色從知識的複述者,變成了知識的審計者。
這場看起來是人機對抗的考試,訓練的其實是人機協作最核心的前提:你知道什麼時候該信它,什麼時候必須自己接管。
探索碰撞 ↗
从这里开始系列动态墙知识图谱碰撞关于搜索联系我
EN
字号