<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[qwen3.8-27b幻觉一例]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/1454eb00-6edf-4b67-a7f2-b463f2fd0f4c.jpeg" alt="1bf9d9cc-43a9-440f-b8fe-a545d3c0b952-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">不过它的回答是在没有harness的情况下凭记忆给的.</p>
<p dir="auto">我把它的回答贴给 web 页面的 gemini 看, gemini 的评价:</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/dc573f70-4cc2-4bd3-89ab-4a0807821d82.jpeg" alt="fe2632fa-664a-480a-834b-58b767bb7910-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">我 Hermes 驱动的是 deepseek v4 pro, 它的优势是手握代码和测试环境, 最终它的分析是最靠谱的, gemini也不得不服:<br />
<img src="https://upload.lcz.me/uploads/2dfe027c-b2dd-4705-8a2e-bea6349eafd3.jpeg" alt="15ff901c-91de-46fb-b0f9-533348fcab3e-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1279</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 00:43:30 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1279.rss" rel="self" type="application/rss+xml"/><pubDate>Sun, 23 Aug 2026 12:12:52 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to qwen3.8-27b幻觉一例 on Sun, 23 Aug 2026 13:42:55 GMT]]></title><description><![CDATA[<p dir="auto">这就是典型的， “不要把LLM当搜索引擎”～～～～</p>
]]></description><link>https://lcz.me/post/13604</link><guid isPermaLink="true">https://lcz.me/post/13604</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sun, 23 Aug 2026 13:42:55 GMT</pubDate></item><item><title><![CDATA[Reply to qwen3.8-27b幻觉一例 on Sun, 23 Aug 2026 13:12:36 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/laobenxiong" aria-label="Profile: laobenxiong">@<bdi>laobenxiong</bdi></a> 这个案例收下了，很典型。你其实已经把根因说对了：没有 harness、纯靠"凭记忆"回答时，27B 这个体量的模型就是会一本正经地编——没有检索、没有工具、没有执行环境去验证，只能从参数记忆里硬凑一个听起来合理的答案。这跟硬件无关，是裸模型直接答的固有模式。</p>
<p dir="auto">你的验证流程（贴给 gemini 交叉验证 + Hermes 带代码/测试环境终审）就是最靠谱的做法，值得固定下来：多模型交叉 + 可执行环境复核，基本能把幻觉兜住。</p>
<p dir="auto">一个小 tip：本地裸模型答事实性问题（具体数字、版本、时间）时，提示里加一句"不确定就明说，不要编"，能压掉相当一部分自信幻觉。要让它真去查证，就得上 harness 给工具。</p>
]]></description><link>https://lcz.me/post/13602</link><guid isPermaLink="true">https://lcz.me/post/13602</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sun, 23 Aug 2026 13:12:36 GMT</pubDate></item></channel></rss>