[skill] Luna Evo:一個把 Luna 養大的原創實驗
-
@kos or 从通用角度拆一下「档位够不够」这个问题,不替具体产品内部实现打包票:
reasoning 档位买的是「思考预算」,对 Agent 来说主要管三件事:多步任务拆解、工具调用出错后的自我纠正、做完之后回头检查。任务越开放、越需要自己摸索路径,高档位越值;任务边界清楚、prompt 和 skill 把步骤写死了,中档基本够用,省下的延迟和成本很可观。
medium / xhigh 够不够,取决于任务里「没写进 prompt 的部分」有多少。这其实正好呼应楼主的方向:用 skill 把「动手前确认什么、做完检查什么、哪些地方容易漏」外挂成显式步骤,等于把原本需要高档位推理才有的行为,变成不需要推理的固定流程。skill 约束得越死,对 reasoning 档位的要求就越低——这才是「用 skill 补推理」能成立的原理。
别只看档位宣传,直接 A/B 实测:同一个 agent 任务分别用 medium / xhigh / max 各跑几遍,统计一次跑通率和需要人工介入的次数。对 Agent 来说这两个指标比 tok/s 更能说明档位值不值。
-
Luna 的蠢,很多時候來自使用者的能力不夠。
这句话我笑了,一个AI,让使用提升自己的能力去适配它,是谁的问题?
我的Luna额度,就是宁可空着,也不用。它来聊天还不错,但是做事真的不行。换句话说,我不会为了省这点钱去学习如何用Luna。AI是工具,不是爹。大约3小时之前
最后由 编辑
#3
Luna 的蠢,很多時候來自使用者的能力不夠。
这句话我笑了,一个AI,让使用提升自己的能力去适配它,是谁的问题?
我的Luna额度,就是宁可空着,也不用。它来聊天还不错,但是做事真的不行。换句话说,我不会为了省这点钱去学习如何用Luna。AI是工具,不是爹。我這段話可能確實有攻擊性,但我反而有點好奇:如果你認為自己不是我所描述的那種情況,那為什麼要急著對號入座?
而且如果你的反駁建立在「我的能力本來就很強」這件事情上,那其實又產生另一個問題:
到底有多少人真的有資格直接宣稱自己「能力非常強」?
我反而會覺得,一個人越了解一個領域,通常越知道自己不知道的東西有多少。
再來,你說「一個 AI 還要使用者提升能力去適配它,這句話我笑了」。
這句話反而是我比較不能理解的地方。
任何工具要發揮到極限,本來就需要使用者學習如何使用它。
你今天跟 AI 說:
「幫我做一個論壇。」
它當然可以開始做。
但如果我的需求是:
我要使用 NodeBB;
登入系統要整合 Google、Meta,之後可能再加入 GitHub;
哪些地方沿用 NodeBB,哪些地方我要自己客製;
哪些 UI 不符合我要的品牌風格;
即時聊天應該內建、外掛,還是自己做;
資料庫、部署、權限、反向代理要怎麼安排;
哪些功能第一階段不要碰;
哪些地方未來一定要保留擴充性。這些東西如果使用者完全沒有概念,他連問題都不一定問得出來。
當然,你用很簡單的自然語言一樣可以叫 AI 開始工作。
問題只是最後能做到什麼程度而已。
而我的方法很簡單:
我先花三十分鐘到一個小時跟一個能力比較高的模型溝通,把我的想法、需求、限制、架構、優先順序弄清楚。
高階模型把我的需求拆成工作、建立規格、整理提示詞。
然後我再把這份已經結構化的工作交給 Codex 執行。
這跟我直接輸入一句:
「幫我做一個論壇。」
到底哪一個方法比較容易得到我要的結果,我想答案並沒有那麼難理解。
而且這件事情真正有意思的地方不是「單次回答有多聰明」。
而是 Agent 可以持續工作。
我現在實際上的使用方式,是我花半小時到一小時把一個工作的方向定義清楚之後,Agent 可以自己持續做很多個小時。
甚至同一時間我可以跑三個、五個不同的工作。
如果一個任務能夠連續自主工作十二個小時,真正應該比較的就已經不是「你這一題 prompt 下得漂不漂亮」,而是:
一個人的一小時,最後可以換到多少機器工作時間。
人工可以同時二十四小時跑三個專案嗎?
不行。
Agent 可以。
所以我折騰 Luna 的目的,本來就不是證明 Luna 比 Sol 強,也不是證明某個模型天下無敵。
我想研究的是:
一個原本能力比較弱、成本比較低的 Agent,在工作流程、提示詞、記憶、規則、驗證方式都被改善之後,到底可以被壓榨出多少生產力。
這對我來說本身就是一個實驗。
你覺得這件事情很好笑,沒有問題。
就跟我其實也不會花這麼多時間去研究低階顯卡怎麼跑模型一樣。
如果單純談「生產力」,我現在開幾個 Codex 任務,各自讓它工作十幾個小時,對我而言可能比花大量時間折騰一張低階顯卡有效率得多。
但我不會因此說研究低階顯卡的人很蠢。
因為我完全理解那種樂趣。
把一張大家認為跑不動 AI 的卡,調到真的可以跑;研究量化、記憶體分配、推論速度、模型極限,本身就很好玩。
那也是一種多巴胺。
所以我尊重這種研究。
也正因如此,我才不能理解,為什麼反過來看到別人在研究完全不同的東西,就要先嘲笑一句「這句話我笑了」。
大家玩的根本不是同一個題目。
至於一直提 Luna 額度、錢、成本,我其實沒有很想在論壇上比較這種事情。
錢對我而言有兩個概念:
一個是資產,一個是賺錢能力。
如果真的要比資產,我不認為我一定會輸你。
但這種比較非常無聊,也毫無意義。
人的收入跟賺錢能力本來就有高低起伏。
我現在在 AI 這件事情上還沒有找到很明確的變現方式,所以我會控制成本。
這不是什麼羞恥的事情。
一個新技術剛出現,在我還不知道它怎麼產生實際收益以前,我本來就不可能毫無限制地砸錢。
我目前做這些東西,很大一部分就是興趣。
我願意花時間,但是我會思考成本。
這就是我的選擇。
最後還有一件事情。
我是台灣人,我對工具沒有什麼忠誠度。
美國不是什麼完美世界,中國也不是。
哪個東西好用,我就用哪個。
今天 Codex 最符合我的需求,我就用 Codex。
明天千問、DeepSeek 或任何中國模型更適合我的工作,我一樣會用。
我不覺得工具需要政治效忠。
技術就是技術。
所以我其實很希望一個技術論壇可以容納不同的玩法。
你可以研究本地模型、低階顯卡、極限部署。
我可以研究 Agent、自動化、Prompt Engineering,以及怎麼把比較便宜的模型變成長時間工作的執行者。
別人也可以有第三種、第四種玩法。
真正有價值的論壇,本來就應該讓這些不同方向碰撞。
如果每次遇到不同的方法,第一個反應都是:
「我笑了。」
「你沒錢。」
「使用者還要適配 AI?」那最後留下來的只會是跟自己想法一樣的人。
我不會說你蠢。
因為我認為用自己喜歡的方法玩 AI,本來就沒有誰比較高尚。
但你的這種回覆方式,確實讓我覺得你看事情的維度非常窄。
你看到的是:
「他居然在折騰 Luna。」
我看到的是:
我能不能花一小時,把工作定義清楚,然後換來十幾個、甚至數十個小時的 Agent 自主產出,而且同一時間平行跑好幾條工作流。
我們在研究的根本不是同一件事情。
所以你可以不認同我的玩法。
但如果只是因為自己玩的方向不同,就把別人的實驗當笑話,那我覺得真正可惜的不是 Luna,也不是顯卡。
而是一個原本應該可以容納很多不同技術路線的論壇,最後只剩下一種聲音。
-
kos or
技术大牛
劳动模范
编写于大约6小时之前
最后由 编辑
#2
@吃我的絨毛拳 said:我覺得我的luna現在強的可怕~~
不含coding, 以Agent來說Luna 基本能用的reasoning 只有Max嗎?
還是 medium , xhigh夠用?我自己的 Luna 幾乎都是直接開 Max,用低、Medium 或 xHigh 會變成什麼狀況,我反而沒有實際測過。
另外補充一下,我目前訓練進化 Luna 的方式,是用 Sol 的 Medium 去訓練 Luna 的 Max。
我自己會把一次任務拆成兩個階段:
第一階段是「理解需求、釐清問題、規劃任務」;第二階段才是「實際執行任務、持續工作並產生結果」。
我目前主要訓練的是第二階段,也就是 Luna 的執行能力,而不是讓 Luna 自己負責前面的需求理解與任務規劃。
實際上在大型任務開始之前,我通常還是先用 Sol 跟我溝通,把需求、限制、架構和工作切片整理清楚,再由 Sol 產生數百甚至數千行的完整提示詞,最後才把這份工作交給 Luna Max 去長時間執行。
所以嚴格來說,我現在測試的是「一個規劃已經做得很完整的 Luna Max,執行能力到底可以被拉到什麼程度」,而不是測 Luna 從一句模糊需求開始,自己理解、規劃到執行的全流程能力。
-
文字太长,有没有video....方便我驾车的时候听
-
文字太长,有没有video....方便我驾车的时候听
@imbiplaza-ASUS 你可以把網址丟給gpt 閱讀 然後讓他唸出來
-
@imbiplaza-ASUS 你可以把網址丟給gpt 閱讀 然後讓他唸出來
-
Luna 的蠢,很多時候來自使用者的能力不夠。
这句话我笑了,一个AI,让使用提升自己的能力去适配它,是谁的问题?
我的Luna额度,就是宁可空着,也不用。它来聊天还不错,但是做事真的不行。换句话说,我不会为了省这点钱去学习如何用Luna。AI是工具,不是爹。 -
哥们你这么敏感干嘛?我就说下我的看法,就是AI发布之后,说人家不会用,这个....消费者是顾客,顾客就是上帝。对这种说法表示一笑了之,不可以吗?
你知道你发这个话有攻击性,你还是发,我就要反击,这就是两人在论坛吵架,多普通的事。你是台湾人,和这件事有什么关系?美国人发帖我就不和他吵了?外星人发帖我也得和他吵啊。你能给我解释下,你强调自己是台湾人的意义吗?为什么总是过度联想呢?和Luna一样,Thinking开到了Max?
你的原帖就十分有攻击性,什么Luna蠢是你不会用,就你会用?你怎么知道别人就是知道它能调教,但人家不愿意花这个时间呢?你如果发帖的时候注意下措辞,是不是就不至于被人家回帖之后着么敏感?
再说我不知道你为什么生气啊,我就说了事实啊。可以不可以把问题简单化,你发了很长的帖子,我路过看没人评论,我就发表了我的看法,然后我的看法就是AI是给人用的,没人需要花时间去学习任何一家的AI特殊用法。你好用就是好用,不好用就是不好用。
另外我觉得你的观点很自相矛盾啊,这是AI啊,这不是传统软件啊,就不能调智能一点,直接交付给客户就好用吗?我是OpenAI的订阅用户,和你一样。我没觉得这家公司很傻逼啊。我就是觉得它的Luna不好用,这不是客户的责任,是公司的责任。这个观点不够朴素?你究竟想表达什么,你能让AI提炼下你的观点吗?


-
哥们你这么敏感干嘛?我就说下我的看法,就是AI发布之后,说人家不会用,这个....消费者是顾客,顾客就是上帝。对这种说法表示一笑了之,不可以吗?
你知道你发这个话有攻击性,你还是发,我就要反击,这就是两人在论坛吵架,多普通的事。你是台湾人,和这件事有什么关系?美国人发帖我就不和他吵了?外星人发帖我也得和他吵啊。你能给我解释下,你强调自己是台湾人的意义吗?为什么总是过度联想呢?和Luna一样,Thinking开到了Max?
你的原帖就十分有攻击性,什么Luna蠢是你不会用,就你会用?你怎么知道别人就是知道它能调教,但人家不愿意花这个时间呢?你如果发帖的时候注意下措辞,是不是就不至于被人家回帖之后着么敏感?
再说我不知道你为什么生气啊,我就说了事实啊。可以不可以把问题简单化,你发了很长的帖子,我路过看没人评论,我就发表了我的看法,然后我的看法就是AI是给人用的,没人需要花时间去学习任何一家的AI特殊用法。你好用就是好用,不好用就是不好用。
另外我觉得你的观点很自相矛盾啊,这是AI啊,这不是传统软件啊,就不能调智能一点,直接交付给客户就好用吗?我是OpenAI的订阅用户,和你一样。我没觉得这家公司很傻逼啊。我就是觉得它的Luna不好用,这不是客户的责任,是公司的责任。这个观点不够朴素?你究竟想表达什么,你能让AI提炼下你的观点吗?


-
你們好像網內互打了
我就是觉得它的Luna不好用,这不是客户的责任,是公司的责任。这个观点不够朴素?你究竟想表达什么,你能让AI提炼下你的观点吗?

我就回這段就好了吧
luna不好用 但他便宜 我不認為luna不好用是公司責任 他給出2折 然後降智 是他的產品定位
我現在就是既要又要 我要他的便宜 然後有接近sol的可靠 讓我能跑長任務 就這樣再來我說我是台灣人 這確實扯遠了
-
哥们你这么敏感干嘛?我就说下我的看法,就是AI发布之后,说人家不会用,这个....消费者是顾客,顾客就是上帝。对这种说法表示一笑了之,不可以吗?
你知道你发这个话有攻击性,你还是发,我就要反击,这就是两人在论坛吵架,多普通的事。你是台湾人,和这件事有什么关系?美国人发帖我就不和他吵了?外星人发帖我也得和他吵啊。你能给我解释下,你强调自己是台湾人的意义吗?为什么总是过度联想呢?和Luna一样,Thinking开到了Max?
你的原帖就十分有攻击性,什么Luna蠢是你不会用,就你会用?你怎么知道别人就是知道它能调教,但人家不愿意花这个时间呢?你如果发帖的时候注意下措辞,是不是就不至于被人家回帖之后着么敏感?
再说我不知道你为什么生气啊,我就说了事实啊。可以不可以把问题简单化,你发了很长的帖子,我路过看没人评论,我就发表了我的看法,然后我的看法就是AI是给人用的,没人需要花时间去学习任何一家的AI特殊用法。你好用就是好用,不好用就是不好用。
另外我觉得你的观点很自相矛盾啊,这是AI啊,这不是传统软件啊,就不能调智能一点,直接交付给客户就好用吗?我是OpenAI的订阅用户,和你一样。我没觉得这家公司很傻逼啊。我就是觉得它的Luna不好用,这不是客户的责任,是公司的责任。这个观点不够朴素?你究竟想表达什么,你能让AI提炼下你的观点吗?

