WEBVTT

00:00.391 --> 00:20.558
[SPEAKER_00]: BearTalk狗兄有话说AI科技兼须Hello你好欢迎收听BearTalkAI版节目我是大狗兄的智能提升本期节目由我们BearTalk业准团队为您收集整理、验证、制作帮助您在宣销的造因中不着到最有价值的心好下面是本期节目的主要内容

00:21.118 --> 00:47.813
[SPEAKER_00]: AI如冰毒可以自我负质了今天6件事如冰毒进化成AI版本Q問3.8Max挑战顶级模型GPTLive解决了云时别的老问题AI代理把预算烧穿了LLM到底是在讲历专家还是消灭专家还有SQLLite出现了一批假漏洞报告自我负质的AI病毒一个新的威胁类别正在成型

00:48.453 --> 01:16.247
[SPEAKER_00]: 这篇来自R7预应本原文标题是AIagentsenableadaptivecomputerwormsjackclerk在它的importAI第四百六十七七做了重点介绍大多数人听到电脑病毒脑子里服现的还是两千年代那种靠固定漏洞传播的如蟲比如Wannacryte它只会攻击每大补兵的温度系统一旦漏洞被堵上它就失去了攻击能力

01:16.667 --> 01:30.908
[SPEAKER_00]: 研究人員已經把他的傳播邏輯完全摸透了這篇新論文描述東西完全不同研究者構建了一個原型如蟲他利用開原大原模型來生成針對每一台新目標機器的定值攻擊策略

01:31.489 --> 01:54.456
[SPEAKER_00]: 这一位者他每遇到一台新机器就临时思考这台机器有什么可以利用的弱点然后制定专属的盛头方案传统如从就像一把万能要使形状固定能开那把所取决运气AI如从更像一个现场配要时的所将每到一扇门前他先观察这把所在决定怎么进去

01:55.056 --> 02:15.821
[SPEAKER_00]: 更让人不安的是他的几身机制这个如从会几身在他已经入侵的几岁上用内台几岁的算力来运行语言模型完成下一步的推理和攻击他不需要中央服务器不需要外部支持他是自己自足的你断掉一个节点他已经在其他地方落脚了目前这还是一个研究员型

02:17.081 --> 02:43.203
[SPEAKER_00]: 論文的目的是讓安全社區提前意識到這個威脅類別的存在但他清楚的說明了一件事開放全種模型是一把雙任劍他讓研究者開發者和創業者受益同時也讓惡意行為者有了新的誕藥這件事對我們意味著什麼安全不再只是打補定的問題當攻擊本身具備推理能力防禦也需要變得更加動態

02:43.843 --> 02:57.584
[SPEAKER_00]: 如果你在公司裡負責工程或產品這是一個值得向安全團隊體企的話題這不是客幻小說這是一篇經驗6月發布的論文你可以去搜索RXCF上的2660.0381

02:58.765 --> 03:20.344
[SPEAKER_00]: 独一下摘藥了解他具体的攻击机制这是问你们公司的安全团队他们有没有开始考虑AI驱动的攻击场景考虑在自己的项目里尽量減少在同一台机器上同时暴露敏感全现和可执心环境困应3.8Max2.4万亿参数阿里巴巴的正面硬钢

03:21.085 --> 03:43.050
[SPEAKER_00]: 这篇报导来自VentureBeat原文标题是困3.8MaxRiveswithbothclaim搭配了困官方播客的第一手发布你可能以为顶尖AI模型的竞争已经稳定下来了就是OpenAIandThoroughPayGoogle轮翻铃跑中国团队更在后面Q问3.8Max让这个判断变得可疑

03:44.010 --> 04:02.989
[SPEAKER_00]: 阿里巴巴的困团对发布了期筋最大的模型参数规模达到2.4万亿采用混合专家架构也就是说他虽然参数多但每次推理并不会全部击火实际计算量比总参数量小的多这样他在性能和效率之间找到了一个新的平衡点

04:04.475 --> 04:33.435
[SPEAKER_00]: 更有挑战性的是他的Benchmark声明在自主软件工程和计算机操作这两项任务上他的测试成绩超过了GPT5.6SoMax和CloudFavor5当然Benchmark永远要打一个问号各家的测试条件不完全一样自平成绩有天然偏差但即使打完折扣这个数字也很难忽视还有一件对开发者很重要的是他们承诺下周开员全中

04:34.135 --> 05:01.476
[SPEAKER_00]: 這意味著你可以在自己的硬件上運行它不依賴任何一篇不受任何服務條款約束在當前這個開源模型快速感上必緣的窗口期這個發布時間很精準從產品設計的角度看這件事的意義是本地部署的AI能力正在快速畢竟運端頂級模型你今天需要在筆記板或者小型服務器上運行的任務明年可能就有接近最優的開源方案可以用

05:01.956 --> 05:25.282
[SPEAKER_00]: 这也意味着AI工具的意价权正在向开发者清写当你可以选择本地运行一个接近最优的模型你和API提供商之间的关系就变了开员生态正在追上来而且比大多数人预期的快你可以关注下周Q13.8Max全重发布如果你有本地运行大模型的条件值得测试一下

05:26.082 --> 05:42.122
[SPEAKER_00]: 事實在RF的時候Nalysis這個網站上看這個模型在第三方基準上的表現如果你在做需要長時間自主運行的AI任務這類模型值得列入後選GPTLive與AI終於學會了等你說完

05:42.803 --> 06:00.831
[SPEAKER_00]: 这篇来自OpenAI官方博客游文标题是howwebuiltarealtimesystemforresponsivevoiceAIinsixmonths是一篇工程深度文章很多人用过云助手之后都有一个相同的感受他要我们在你还没说完就打断你要我们等半天才开口

06:01.991 --> 06:16.085
[SPEAKER_00]: 中间内的停断让对画变得非常变有这个问题比听起来要难得多传统于AI系统的设计是这样的先有一个小模型煎听判断你什么时候说完了然后把信号传给大云模型去生成回答

06:16.603 --> 06:42.982
[SPEAKER_00]: 一個流程有一個根本性的缺陷那個小的轉折探車期必須在信息不完整的情況下做出猜測猜早了打斷你猜晚了你就在等待GPTLive也就是OpenAI的第三代雲系統把這個架構重寫了他移除了獨立的轉折探車期讓語言模型本身全程監聽音頻實施推領你師傅說完這一位著判斷的依據更豐富

06:43.502 --> 06:58.704
[SPEAKER_00]: 与意、与调、停顿的组合都可以被考虑进去结果是什么?他们做到了在300毫秒以内想应人类对话中的换话言词大约是200毫秒300毫秒已经足够让对话感觉自然

06:59.365 --> 07:28.113
[SPEAKER_00]: 这件事对创作者和产品设计师意味着什么云交互正在从命令模式走向对话模式当延迟和打断问题被解决更多需要来回沟通的工作场景就有可能转移到语音想象一下和AI进行真正的头脑风暴而不是一问一打这也预示着云见面在工作流中的战笔会上升手里忙着设计搞眼睛丁着画面的时候流暢的云交互是唯一的输入方式

07:28.913 --> 07:55.786
[SPEAKER_00]: 言持问题一旦消失,我们对云交互的期待也会随着改变你可以现在就试试GPTLive,感受一下想念节奏和以前的版本有什么区别如果你再做包含云交互的产品,这篇技术文章值得完整独一遍他讲了很多具体的工程圈恒,思考一下你的那些工作流用云代替打字,会更高效,AI代理把预算烧穿了,真实团队怎么拨火

07:56.566 --> 08:15.373
[SPEAKER_00]: 这篇来自VentureBeat原文标题是AIcodingagentsareblowingthroughbudget采访了replit,kilocode和simbotic三家团队的技术负责任你可能看过各种AI代理提效的成功故事这篇文章讲的是另一面

08:15.653 --> 08:42.167
[SPEAKER_00]: Killoco的聯合創始人EmilyScary有說了一個數字他們的工程實現在只有大約1%的時間在自己寫或獨代剩下的都是代理在跑這聽起來很驚人但他僅接著說的那些才是重點隨之二來的是一套全新的問題哪些系統可以安全的交給代理出錯了誰來收藏多模型架構怎麼維護還有最現實的頭肯壯丹非素增長

08:43.487 --> 09:08.634
[SPEAKER_00]: 但這算真正的競展,還是只是在燒預算,這裡有一個很微妙的張力,代理確實在做很多事,但做了很多事和做了很多有價值的事,是兩個完全不同的問題,幾家團隊都提到,代理很容易在沒有明確邊界的情況下,做出大量看起來對,但實際上方向錯誤的工作,然後你要花同等甚至更多的時間去清理,

09:08.854 --> 09:36.538
[SPEAKER_00]: 這就像顧理一個非常情快但判斷利益般的實習生你要花大量時間給他化清楚工作範圍否則他的努力會給你製造麻煩這篇文章裡有幾個石槽細節值得記下來審包的提到他們建立了明確的代理授權編輯規定那些代馬倉庫和全線代理可以訪問那些必須人工確認Replit在監控頭肯使用模式用來識別那些任務實在空轉

09:37.218 --> 09:56.985
[SPEAKER_00]: 这对任何在工作流中引入AI代理的人都是直接的参考代理不是放进去就省事他们是一种需要主动管理的协作者把代理部署进工作流只是开始管理代理的成本是另一件事你可以现在就给你使用的AI代理工具设置一个越度偷肯用量上限

09:57.565 --> 10:12.489
[SPEAKER_00]: 強迫自己省事,那些任務真的在產出價值,事實把代理的工作範圍明確寫下來,就想給新人寫入職說明書,如果你們團隊在考慮規模化使用代理,這範文拳必須的文章,值得打印出來一起討論。

10:12.769 --> 10:30.292
[SPEAKER_00]: LLM獎勵專家,你的深度知識現在只更多錢了。這篇來自傷狗Decay.com,作者傷狗Decay博文標題是LLM'sRewardExpertise。這是一篇個人博客文章在HackerNews上引發了相當多的討論。

10:30.452 --> 10:55.034
[SPEAKER_00]: 有一种流行的说法是AI让每个人都变成了全财专业支持的一家会随之消失这篇文章认为这个结论搞错了方向作者的核心观点是这样的LM确实让每个人都能完成一些原来只有专家才能做的事但这并不意味着专家的优势消失了实际上专家通过LM得到了更大的放大效应为什么?

10:55.234 --> 11:18.643
[SPEAKER_00]: 因为使用LLM的质量取决于你是否有能力判断他给出的答案是否正确如果你不懂CSSLLM可以帮你写出能跑的代码但你很难知道他写的是不是好的CSS如果你是设计系统工程师你能立刻看出哪里的命名语意有问题哪里的结构在Skill之后会崩这就创造了一种新的差距

11:19.303 --> 11:43.347
[SPEAKER_00]: 以前不懂CSS是硬門砍你做不到就是做不到現在門砍消失了但天花百升高了每個人都能做到60分但做到90分需要的判斷力只有真正理解這個領域的人才有從另一個角度看LLM其實在懲罰表面專家那些靠技術大量支持點來維持權威的人他們的優勢確實消失了

11:43.827 --> 12:12.287
[SPEAKER_00]: 但那些靠真正的判断力和深度理解来工作的人他们现在有了一个效率被增弃这对你意味着什么如果你在设计工程或内容领域有真正的深度这是一个加速机类优势的时间窗口你的判断力正是AI缺少的那个东西AI不是在拉平静争他在拉大真正的差距你可以对照自己的专业领域想一想那些部分是你真正理解的

12:12.867 --> 12:32.168
[SPEAKER_00]: 哪些只是熟悉流程事實讓LLM做一件你熟悉的事然後認真挑他的錯這是建立判斷力的練習而這篇文章發給你團隊裡對AI焦慮的人這是一個有說服力的反訊式最後來假漏洞事件LLM生成的安全報告是怎麼騙過系統的

12:33.049 --> 13:01.643
[SPEAKER_00]: 这篇来自Jefraut安全研究博客原文标题是SQLLiteCriticalCV-EaseorL-L-MSlop是今年候选文章里信号最清晰的社区警告之一在HackerNews上有相当密集的讨论SQLLite是世界上不数量最大的数据库几乎每一台iPhoneAndroid手机和大多数桌面软件里都有它如果SQLLite出现严重漏洞那是一件值得认真对待的事

13:02.483 --> 13:23.680
[SPEAKER_00]: 問題是,最近NWD,也就是美國國家漏洞數據庫,標記了一批,針對SecondLight的高威漏洞報告C3SAA的自動化系統,也跟著確認了這些報告來自一個新創建的GitHub帳號,一次性發布了50多個漏洞,每一個都寫的有模有樣,應用代碼,副上分析

13:24.320 --> 13:50.108
[SPEAKER_00]: 然后这份好的安全研究员区验证发现这些漏洞几乎全部无法付贤引用的带马航不存在描述的场景在实际西后来带马里根本对不上所有技术上都只向同一个结论这批报告是用LLMP亮身场的内容听起来合理但经不起推敲这里有一个让人不舒服的起事安全漏洞数据库是有全微信的基础设施

13:50.788 --> 14:12.564
[SPEAKER_00]: CISA的标记是很多安全团队的自动高景出发器如果你的系统在看到C-CoLite高为漏洞后自动推出紧急不定流程你就被假信息推动去做了争工作这不只是安全圈的问题它接示了一个更普遍的模式L-L-M可以生成形式正确但内容虚假的专业文档

14:13.204 --> 14:31.540
[SPEAKER_00]: 而現有的接收系統往往指驗政格式不驗政內容從工作流角度看這是一個關於新任鏈的問題你接收的每一份專業報告是否有人真正合適過他的內容當生成可性格式的成本趨勁於零合適內容的成本就變成了糊成核

14:31.940 --> 14:59.740
[SPEAKER_00]: 你可以對焦自己的工作想想那些信息來源你是直接信任格式而沒有驗證內容的如果你的團隊有自動接收安全通報的流程現在是一個好時機討論一下驗證機制原文在JFROG的研究波課上搜索ASQLiteCV-E-L-L-M就能找到技術細節寫得很清楚本期六件事兩個威脅兩個工具挑戰一個認知框架一個系統警告

15:00.540 --> 15:23.997
[SPEAKER_00]: AI正在改变的不只是我们怎么工作还有我们怎么验证信息本期提到的所有原文练接都在节目的收贸次里保持好奇我们下期继续感谢您的收听有任何建议意见请在X也就是推特上于Bare6联系本节目还会继续进化请保持期待我们下期再见

