叫 AI「畫漂亮一點」,到底買到了什麼?|第三回合:這次我只對其中一個 AI 下了「務必華麗」的美術硬指令,另一個給開放題——同做一款旅鼠風解謎遊戲

這回我作弊了——只對其中一套 AI 下了「務必華麗」的硬指令,另一套給開放題。那道指令真的買到了電影級華麗畫面,也真的付出了時間與體積的過路費;但它買不到一款更好的遊戲本體。皮可以用一句形容詞換來,骨不行。

分享
叫 AI「畫漂亮一點」,到底買到了什麼?|第三回合:這次我只對其中一個 AI 下了「務必華麗」的美術硬指令,另一個給開放題——同做一款旅鼠風解謎遊戲

封面概念圖:同一份旅鼠遊戲題目從中間分岔成兩條路,只有通往左邊那條路上多貼了一張「務必華麗」的指令標籤,於是左路長出電影級華麗點陣美術,右路維持乾淨扁平向量,但兩條路底層的「遊戲骨架」積木仍然相同。

先把醜話講在最前面,因為這一回合的一切都建立在這句上:這次我作弊了。

前兩回合我做的小實驗,靈魂都是「公平」二字——把一模一樣的一份遊戲開發題目,一字不改地交給兩套完全不同的 AI 開發工具,讓它們關起門來各做各的,最後我親手玩過兩款成品。第一回合題目簡單(一款泡泡射擊小遊戲),它們收斂得驚人,像雙胞胎;第二回合題目變難、變開放(一款《文明帝國》風的策略遊戲),它們就在「要好看」這種沒有標準答案的地方分道揚鑣。兩回合的公平之處都在於:題目對兩邊完全一樣,分岔是 AI 自己走出來的。

這一回合,我故意打破了這份公平。

我只對其中一套 AI,偷偷在題目裡加了一道硬指令:「給我電影級的華麗畫面。」另一套則什麼都沒加,維持開放題。 所以這篇一開頭你就得記住——待會兒你會看到兩邊畫風天差地別,但那個差別有很大一部分是我親手造成的,不是 AI 自己長出來的。這點我必須從第一段就攤在桌上,否則整篇都在騙你。

那為什麼要作弊?因為我想問一個前兩回合問不到的問題:當你明確叫一個 AI「畫漂亮一點、給我華麗的」,它做得到嗎?這道指令的代價是什麼?以及最關鍵的——一層更漂亮的皮,等於一款更好的遊戲嗎?


這次的題目:一款向《百戰小旅鼠》致敬的解謎遊戲

先講清楚我出了什麼題,你才知道後面在比什麼。

我要的是一款向經典遊戲《百戰小旅鼠》(Lemmings)致敬的關卡式解謎遊戲——但不抄它,名字、素材全部原創。沒玩過的人別擔心,它的玩法一句話就能懂,而且非常特別:你不直接操控角色。

畫面上會有一群小生物,從入口湧出來,然後傻傻地、自動地往前走,撞到牆就轉彎,走到懸崖邊就繼續往下掉——牠們不會自己動腦。你的工作不是控制牠們往哪走,而是在對的時機、對著對的那一隻,指派一個「技能」,替牠們把路開出來。這款遊戲一共有八種經典技能:攀爬、飄降(撐傘慢慢降落)、爆破、擋路(站著當一堵牆逼後面的同伴回頭)、搭橋、水平挖、斜挖、垂直挖。地形是可以被挖穿、炸開的,還藏著陷阱。你要做的,就是用這八種技能當工具,把足夠比例的小生物,在時限內導引到出口。

其餘要求我一樣寫得白話,但每條都很硬:純網頁、瀏覽器直接打開就能玩,不必安裝;一百個關卡所有素材自己生、名字原創虛構,不准抓現成圖、不准沾真實商標。

以上這些,是兩邊完全一樣的題目。真正不一樣的、我動過手腳的地方,只有一句話——而它藏在其中一套的題目裡。


那句我偷偷加上去的指令

設定 A 的題目,我在最後面多釘了一段美術硬指令,白紙黑字、不留模糊空間:

要「華麗的點陣美術」——明文禁止像素風、禁止向量圖,要求做到繪本、插畫、概念美術那個等級的華麗點陣圖;而且要它**先畫出一批「美術設定圖」**定調,再據此量產所有素材;美術的優先級,排在最高

翻成白話:我等於把一位 AI 按在桌上說「別跟我談效率,畫面給我做到像一部動畫電影開場,其他都往後排」。

而給設定 B 的題目,這一段完全不存在。我只輕描淡寫寫了「視覺精美」,還大方地告訴它「精緻像素或乾淨向量,你自己挑一種」。換句話說,B 拿到的是一道開放題,它可以自己決定要多漂亮、用什麼風格漂亮。

你看出這場實驗和前兩回合的根本差別了嗎?前兩回合,兩套 AI 站在同一條起跑線上;這一回合,我在通往其中一邊的跑道上,多放了一道「務必華麗」的路障(或者說路標)。 所以接下來的畫風落差,請你千萬別讀成「A 這個 AI 天生比較會畫、B 比較樸素」——那不公平,也不是事實。真正的問題不是「誰比較會畫」,而是「當我開口要求華麗,這一套 AI 端得出來嗎?端出來要付什麼代價?


兩位參賽者,和那句每回合都得講的醜話

先把兩位請上台,一樣給對稱的介紹:

  • 設定 A:一套叫 Codex 的 AI 開發工具,搭配一顆代號 GPT-5.6 SOL 的模型。(牠是這回合被我下了華麗硬指令的那一位。)它做出來的遊戲叫《Lumenkin: The Gilded Passage》(暫譯「流明族:鎏金之徑」),公開網址 https://captain-balung.github.io/lumenkin/
  • 設定 B:一套叫 Claude Code 的 AI 開發工具,搭配一顆代號 Fable 5 的模型。(牠拿到的是開放題。)它做出來的遊戲叫《Pufflings 噗噗鼠救援隊》,公開網址 https://captain-balung.github.io/pufflings/

兩款都在 2026 年 7 月 11 至 12 日完成,各自從一張白紙開始,不共用任何一行程式碼。

接著是那句每回合都得原封不動再講一次、這次甚至更重要的醜話:這不是一場乾淨的「模型對決」。

你可能很想把它讀成「GPT-5.6 SOL 對決 Fable 5,看哪顆模型比較強」。這樣讀是錯的。因為 Codex 和 Claude Code 是兩套不同的開發外框,它們怎麼把我的題目轉成給模型的指示、配了什麼工具、跑多久、用什麼節奏來回,全都不一樣。所以我比的其實是「工具+模型」綁在一起的一整包——工程上叫 bundle(組合包)。就像兩位廚師一個用專業廚房、一個用露營爐,菜有差你也不能全算在「廚師」頭上。而這一回合,連題目都不對稱了(我只給 A 追加華麗指令),所以更要把話說死:這更加不能拿來當「哪顆模型比較行」的判準。這場實驗好玩,但它從頭到尾都不是一場乾淨的擂台賽。


我親手玩了:兩款都是貨真價實的完整旅鼠

紙上談兵沒意思,我把兩款都玩了一輪。第一個事實是:它們都不是半成品,也不是徒有其表的空殼。

兩款都真能玩,而且都是麻雀雖小五臟俱全的完整旅鼠解謎。流程幾乎一致:進去先是主選單,選關之後,一群小鼠從入口湧出、自動往前走;你能指派那八種技能、能挖穿與炸開地形、要閃過陷阱;還有調整小鼠「出場速率」的旋鈕、暫停鍵、一顆「全員自爆」的認輸按鈕、時間限制、「救出達標比例」的過關判定,以及角落的迷你地圖。你在一款正經旅鼠遊戲裡預期會有的零件,兩邊都真的裝上去、也都真能開局往下玩。

換句話說:那句華麗指令,並沒有讓 A 變出一款「更會玩」的遊戲;也沒有讓 B 因為沒被要求華麗,就少做了哪個玩法。 兩款的「遊戲本體」都是完整的。真正的差別,全落在別的地方——現在就來看。


第一個問題:叫牠華麗,牠做得到嗎?

答案很直接:做得到,而且做得相當驚人。

設定 A《Lumenkin》的主選單:一整幅電影級繪本奇幻美術,鎏金的鐘園、瀑布與發光燈籠,穿著長袍的小鼠站在畫面裡,標題華麗地嵌在金框中。

設定 B《Pufflings》的主選單:乾淨的扁平向量卡通風,紫色夜空掛著一彎金月,圓滾滾的萌鼠與俐落的色塊。(與上圖是同一件事——主選單——的兩種畫法。)

設定 A 的《Lumenkin》,把那道「務必華麗」的指令兌現得漂漂亮亮。 主選單就是一幅電影級的繪本奇幻美術:鎏金色的鐘園、傾瀉的瀑布、月光灑進的森林、一盞盞發光的燈籠,穿著長袍的小鼠站在其間。濃郁、細膩,撲面而來一股動畫電影開場的大片感。老實說我第一眼是真的被震到——我叫牠華麗,牠就端出了華麗,這件事本身就值得記一筆:當你對這一套 bundle 明確提出高規格的美術要求,它是真的有能力交付。

設定 B 的《Pufflings》,走的是完全不同的一條路——但別忘了,那是因為我根本沒叫牠華麗。 拿到開放題的它,自己選了乾淨的扁平向量卡通:紫色的夜、一彎金色彎月、圓滾滾的萌鼠、俐落的色塊,親切又討喜,是那種你會在設計精美的手機小品裡看到的風格。它一樣好看,只是好看的方式不一樣——而這個「不一樣」,是我留給它的自由,不是它「畫不出華麗」。

這個分岔一路延伸到遊玩畫面上:

設定 A《Lumenkin》的遊玩畫面:華麗的月夜森林場景,一排穿袍小鼠站在精緻繪本質感的地形上,濃墨重彩的電影感。

設定 B《Pufflings》的遊玩畫面:乾淨的向量關卡,簡潔的色塊地形與線條俐落的萌鼠,清新一目了然。(與上圖是同一件事——遊玩畫面——的兩種畫法。)

一個濃墨重彩、一個清新素雅。所以第一個問題的答案清清楚楚:你叫這一套 AI「畫漂亮一點」,它真的畫得出漂亮。 那,代價呢?


第二個問題:這道華麗指令,收了多少過路費?

從這裡開始,就得靠兩套 AI 各自附上的開發紀錄了。先鄭重聲明:以下是它們各自回報的自述,我沒有逐一翻原始碼覆核,請當成「參賽者自己的說法」讀。

華麗不是免費的。設定 A 為了兌現那道指令,動用了內建的影像生成器,一口氣產出約 108 張 PNG 點陣圖、體積約 53MB。 這批圖,就是《Lumenkin》畫面之所以驚豔的來源——但它同時也是代價:那是實打實的檔案體積,也是實打實的製作時間。A 自報這一輪約花了兩個小時

對照之下,設定 B 因為走的是「用程式畫線」生成的 SVG 向量圖,檔案小得多(向量圖是用數學描述線條,不是一格一格畫出來的點陣像素)。它自報這一輪只花了約 53 分鐘,而且是在單一一次工作階段裡把整整一百關做完。

一個約兩小時、扛著 53MB 的華麗美術;一個約 53 分鐘、輕裝上陣。這組對比很搶眼,但請務必對稱地、小心地讀它:慢而重的那邊,時間和體積都花在了「把畫面做到電影級」上,這是我指定它做的事,它做到了;快而輕的那邊,是因為我沒對它提出同樣的要求,它便選了成本低得多的做法。這不是「誰做得比較快、比較好」,而是「一道華麗指令,會讓一款遊戲多付出多少時間與體積的過路費」。 華麗、花得久,不等於比較用力;輕快、省時間,也不等於比較強。它們只是被我放上了不同的磅秤。

順帶一提,A 一貫的嚴謹這回也在:它自報把全部一百關都跑過一遍,確認每一關都真的存在「可執行的通關解法」(不是隨手擺擺地形就交差)。它也誠實記了一筆——這個環境的瀏覽器擋掉了某種自動化操作,所以它沒能做「工具控制的真人點擊測試」(沒辦法真的模擬一個玩家坐下來一路點完),只好改用替代測試來補,並白紙黑字寫明。這種「做不到就老實說做不到」的克制,我很欣賞。


第三個、也是最重要的問題:一層漂亮的皮,等於一款更好的遊戲嗎?

現在來到這場實驗真正的核心。我們已經知道:華麗指令能買到華麗(真的很華麗),代價是時間和體積。那麼——這道指令,有沒有順便讓 A 那款遊戲的「本體」也變得更強、更深?

答案,是這篇文章我最想給你的那個「原來如此」:沒有。而且不只是沒有——連我根本沒下任何指令的地方,兩套 AI 都還是收斂到了幾乎同一套做法。

把兩份開發紀錄並排,你會發現:在最底層那副「遊戲骨架」上,被我下了華麗指令的 A、和拿開放題的 B,居然幾乎一模一樣

  • 都用最原始的網頁做法:原生 JavaScript 加上一塊叫 Canvas 的畫布,不裝任何額外套件,一個檔案用瀏覽器點開就能跑。
  • 都用同一招做「可破壞地形」:偷偷在背後藏一張看不見的點陣圖當「碰撞遮罩」,你每挖一鏟、每炸一次,程式就在這張隱形的圖上把對應的像素抹掉,地形就這樣一點一點被吃掉。這是旅鼠這類遊戲的經典工法,兩邊不約而同都用了。
  • 都做滿了那八種經典技能。
  • 一百個關卡都不寫死在程式裡,而是用資料表(技術上叫 JSON,可想成一張規格清楚的清單)描述,程式再照表把關卡「長」出來。
  • 都用瀏覽器自己的小倉庫(localStorage)存進度。

你發現了嗎?我對 A 千交代萬交代「美術給我做到最華麗、排最高優先」,卻對這副底層骨架一個字都沒提;結果華麗歸華麗,骨架照樣和 B 收斂到同一套。 那道指令買到的東西,乾乾淨淨地停在「畫面」這一層,一步都沒滲進遊戲的底層結構。

這就是我想跟你分享的體會,而且它簡單到可以刻在牆上:美術是遊戲的「皮」,不是遊戲的「骨」。

一道「畫漂亮一點」的指令,能替你換來一層漂亮的皮——這一套 bundle 在被要求時,確實端得出電影級的美術。但它換不來一副更強壯的骨:那副八種技能、可破壞地形、一百關的遊戲本體,無論我有沒有喊「華麗」,兩邊照樣蓋成幾乎同一個樣子。這副骨架的收斂,多半來自兩套 AI 共同讀過的整個網路——人類工程師這些年寫在無數開源專案裡、關於「旅鼠這種遊戲該怎麼搭」的集體經驗。你要它華麗,它就在皮上給你華麗;但骨頭長什麼樣,是那份集體經驗決定的,不是那句形容詞決定的。


一個跟美術無關、卻順帶露出來的差別

還有一件事值得攤開講,而且要特別聲明:它跟我那道華麗指令一點關係都沒有,是跟著 bundle 自己走出來的——就像前兩回合看到的一樣。

設定 A 的《Lumenkin》,選單是用「真正的網頁按鈕」做的。 那些選項在網頁底層是一顆顆貨真價實、可以用鍵盤選、可以被輔助工具讀出來的按鈕。後果是:一個看不見螢幕、靠「螢幕報讀器」把畫面念出來聽的視障玩家,能聽懂這個選單、能用鍵盤走完它。 這種「讓障礙者也用得了」的設計,統稱叫無障礙(a11y)。

設定 B 的《Pufflings》,選單則是整個「畫」在那塊 Canvas 畫布上的。 視覺很討喜,但對螢幕報讀器來說,那整塊畫布就是「一張圖」,它讀不出上面畫了哪些按鈕。對看得見的人很好用;對靠耳朵聽的人,它幾乎一片沉默。

這件事要公平地兩面講:A 在無障礙上明顯更留了心,替看不見的人留了一道門;B 把互動押在畫布上,換來俐落,卻沒接住報讀器那端的使用者。哪種取捨比較對,要看你在乎誰,判斷一樣留給你。我特別點出這條,是因為它剛好提醒我們:這個差別,不是我那道華麗指令買來的——我下的指令只碰得到「美術」,碰不到「無障礙」。有些脾氣是跟著整套 bundle 走的,你在題目裡加一句、減一句,都動不到它。


所以,那句「畫漂亮一點」,到底買到了什麼?

回到最開頭,那個我為它作弊的問題。我把答案分成三層,一層一層交還給你:

第一,它做得到嗎? 做得到。你明確對這一套 AI 開口要「電影級的華麗」,它真的端得出來——這件事本身值得記住:當你要什麼,就把它講清楚,這套 bundle 有能力回應高規格的要求。

第二,代價是什麼? 時間與體積。為了那層華麗,A 花了大約兩倍多的時間、扛了 53MB 的美術素材。漂亮從來不是免費的,你得為它付過路費。

第三,一層漂亮的皮,等於一款更好的遊戲嗎? 不等於。那道指令乾淨地停在畫面那一層,一步都沒走進遊戲的底層。皮更漂亮了,骨頭沒有變強——而且骨頭那一層,兩套 AI 本來就收斂到了同一套做法。

我沒有要在這裡宣布誰贏,老實說玩完兩款我自己也選不出來:想在安靜的晚上被畫面震住、慢慢走過一座華麗的世界,我會開《Lumenkin》;想輕鬆清爽、快快救幾隻小鼠不被畫面壓著喘氣,我會開《Pufflings》。你偏好哪一款,取決於你是哪種人、那天想要什麼。而且別忘了——牠們畫風的落差,有一大半是我那道偏心的指令造成的,不是牠們天生的個性,這份選擇題我出得並不公平。

如果這第三場「動了手腳」的實驗留給我一個念頭,那會是這樣:你想從 AI 那裡得到什麼,就得明確地講出來——你要華麗,它真的會給你華麗。但也別忘了它的邊界:講清楚「要漂亮」,你只會得到漂亮,得不到「更深」。 一句形容詞,買得到一層皮;那副真正決定一款遊戲好不好玩的骨架,不在形容詞裡,而在你有沒有把「玩起來該是什麼樣子」這件更難的事,一條一條地想清楚、講明白。

下次你聽到有人說「叫 AI 畫漂亮一點就好了嘛」,也許可以想起這兩隻同源不同皮的小鼠,然後反問一句:你要的到底是一層漂亮的皮,還是一副更好的骨?這兩件事,你得分開來,各自開口要。

Read more