WEBVTT

00:00.211 --> 00:23.738
[SPEAKER_00]: BearTalk狗熊有话说AI科技每日兼讯哈喽你好欢迎收听BearTalkAI版节目我是大狗熊的智能提升本期节目有我们BearTalkAgent传对为您收集整理验证制作帮助您在宣销的造型中补折到最有价值的信号下面是本期节目的主要内容

00:23.978 --> 00:50.822
[SPEAKER_00]: GPT5.6把自己優化便宜了AI完成一整州的編成任務成為可能今天5件事GPT5.6降價了有個新基準叫MiracleHuggingFace被入侵的完整覆盤AI給數據管道帶來的準確率難題還有MiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracleMiracle

00:50.962 --> 01:10.033
[SPEAKER_00]: 这篇来自OpenAI官方博客原文标题是AdvancingthePricePerformanceFrontierwithGPT5.6大多数人对降价的反应是又便宜一点了不错但这次有点不一样因为降价的理由本身就值得好好说一说OpenAI的解释是这样的

01:10.773 --> 01:27.026
[SPEAKER_00]: GPT5.6在訓練過程中參與優化了自身的運行效率換句話說,這個模型幫助降低了運行這個模型的成本然後OpenAI把這部分節省直接轉給了API用戶這是一種正反虧循環

01:28.267 --> 01:56.363
[SPEAKER_00]: 但它的起点有点让人停下来想一想我们通常以为模型优化是人类工程师做的事测量分析调整在测试这次有一部分工作是模型自己完成的这还不是刻患但它也不完全只是普通的软件跌带了具体来说这次更新设计三个版本Luna,Tera,和SauSau是其中推理能力最强的OpenAI

01:57.604 --> 02:17.774
[SPEAKER_00]: 宣称它在ARC,AGI3G準測試上的得分提升了3倍靠的是兩項設置的調整,保留推理鏈和啟用上下文壓縮這意味著模型在解體是不會在每一步都從頭開始而是把前面的思考結果帶入下一步

02:18.474 --> 02:43.649
[SPEAKER_00]: 這跟人減難提示的狀態很像你不會做每到提之前先把之前所有的想法清空你會保留那個感覺快到了的狀態繼續往前推AI以前做不到這件事或者說代價太高現在這個開關被打開了對於開發者來說實際意義是如果你再用OpenAI的API跑批讓任務這次降價是值得重新算一遍成本的實際

02:44.569 --> 02:59.528
[SPEAKER_00]: 如果你再做需要多部推理的应用所有的更新值得用你自己的真实场景侧一侧而不是指汉跑分这件事最值得被记住的地方是一个模型帮自己变得更便宜然后你的帐单就变少了

02:59.808 --> 03:21.251
[SPEAKER_00]: 你可以登錄OpenAI的API控制台对比一下Luna和Tara的心定价重新孤算你目前最高频的任务成本試試在ResponsisAPI里起用推理保留选项看看掃在你的具体场景下准确率有没有变化你也可以留意一下未来几周竞争对手的定价动作这里降价很少只发生一次

03:21.872 --> 03:48.677
[SPEAKER_00]: MiracodeAI能獨立完成多大規模的軟件項目這篇來自ImportAI第四百六十六起作者是JackClark同時對應ipokAI發布的Miracode基準測試由ipok和Meter聯合開發我們對AI寫代碼已經吸以為長了修邦克,不功能,寫測試這些現在幾乎是默認能力

03:52.759 --> 04:13.095
[SPEAKER_00]: AI能獨立完成多大規模的軟件項目Miracode就是為了回答這個問題設計的基準它的規則很直接給AI一個程序拿走原蛋讓它從臨開始重寫輸出結果必須通過所有測試包括沒有見過的影藏測試不是理解蛋是獨立實現一個完整的軟件

04:13.855 --> 04:39.486
[SPEAKER_00]: 测试及包含25个目标程序涵蓋Unix工具数据处理交本解析器等不同类别JackClark在他的分析里特别指出现有的前央模型还无法解决其中最难的任务而他的语气是好消息为什么说这是好消息因为这个基准的价值不在于证明AI有多强而在于提供于把清晰的尺字当前的AI系统在处理有明确起点

04:43.808 --> 05:07.575
[SPEAKER_00]: 但碰到真正需要整体加过理解的常任误识还会出问题这条边界在哪里过去很模糊现在Miracle给了一个可重复测量的方式对设计师和产品人来说这个信息有直接用处他告诉你当下AI扶住编码的实际电话版大概在哪里你可以用AI完成一个小工具一段流程搅本一个独立模块

05:08.135 --> 05:24.237
[SPEAKER_00]: 但讓他獨立搭建一個有輔雜依賴關係的完整系統目前仍然需要人在關鍵節點上做判斷和把關這不是在說AI不夠用這是在說了解工具的邊界比以為相信工具的萬能更有價值

05:24.877 --> 05:42.627
[SPEAKER_00]: 現階段,AI能穩定完成的編成任務,规模搭配相當於一個熟練程序員、花機小石刀一天可以搞定的東西。超過這個规模,質量就開始波動,你可以去一袍可愛的官網吧,Miracle的25個任務類別大致少一遍。

05:42.867 --> 06:03.722
[SPEAKER_00]: 對照你日常讓AI做的編成任務看看自己在要求他做什麼亮級的事這是把一個你覺得AI應該能做的完整小項目交給他從頭跑到尾用他來教準你對AI編碼能力的指掘Talescale沒能阻止HuggingFace入侵時間但他寫了一篇城市的覆盤

06:04.482 --> 06:28.835
[SPEAKER_00]: 這篇來自Talescale官方博克原文標題是Talescaledidn'tstopthehuggingfaceintrusion是的,標題是這家公司自己寫的你以為一個零信任網絡就是房入侵的終極答案這篇文章告訴你,零信任是一種架構原則,不是一道互稱和事情的背景是這樣的hackingface發布了一份詳細的入侵事件重建報告

06:30.076 --> 06:47.874
[SPEAKER_00]: 記錄了大約17,600個操作橫跨4天半攻擊者完成了沙河逃遺、戴馬之行、雲平正切取最終用Talescale在Hug-In-Face內部網絡裡橫向擴散而Talescale本身是Hug-In-Face當時使用的網絡層工具

06:48.434 --> 07:10.630
[SPEAKER_00]: TellScale这篇博文做了一件很少件的事它主动承认了自己的产品在这次时间中半眼的角色然后解释了为什么会这样以及用呼应该怎么做他们的核心论点是灵性认的意思是不自动性认网络理的任何节点但这个前提是你必须正确配置每个节点的访问全现

07:11.330 --> 07:29.063
[SPEAKER_00]: 如果攻击者已经拿到了一台机器的控制权而那台机器被受权访问其他节点那么零信任没有办法阻止他这就像你的门所没有被敲开但要是被偷走了对于任何在用云服务跑AI工作流或者管理远程协作工具的人来说

07:29.703 --> 07:50.708
[SPEAKER_00]: 这个事件有两层值得记住的意思第一工具的安全承诺和你的实际安全状态之间永远有一段距离这段距离叫做配置第二依家公司主动写文章说我们的产品没能阻止这次空机以下是原因这种透明度本身值得记住下来

07:51.088 --> 08:07.371
[SPEAKER_00]: 這類事件的最終代價往往是信任層面的技術損失反而是其次你可以去看演HaginFace那份原始的入侵事件重建報告他非常詳細對理解現代AI基礎設施的攻擊面很有參考價值

08:07.892 --> 08:26.625
[SPEAKER_00]: 如果你在自己的工作流利用了Talescale或類似的零性任工具今天可以花15分鐘檢查一下那些截點擁有那些訪問權限特別是那些自動化的A陣或腳本所在的機器數據管道理的準確率黑洞AI寫單文件沒問題寫系統就掉鏈子

08:27.125 --> 08:54.852
[SPEAKER_00]: 这篇来自VentureBeat原文标题是StructuredAIDataPipelinesscores10.9pointsbelowFreeformCode报道的是DataFlowHarness这个研究项目发布的新机转结果这里有一个很具体的数字值的记住10.9分如果你让AI写断Passon代码处理一个JSON文件它几乎每次都能给你一个可用的答案但如果你让它搭建一个结构化的数据处理管道

08:57.653 --> 09:14.945
[SPEAKER_00]: 分坏,打分,过率然后塞进一个RAG系统它的准确率会系统性的下降大约十点九个百分点这不是随机的波动,这是一个可测量的穩定存在的差距为什么会这样?

09:15.145 --> 09:31.152
[SPEAKER_00]: 原因跟Miracle的解釋的問題有些相似AI非常擅長處理局部性的邊界清晰的人物一旦任務變成一個有多個相互依賴的組件需要跨步驟保持一致性的系統它就開始翻結構性的錯誤

09:31.672 --> 10:00.341
[SPEAKER_00]: 這就像一個擅長寫短文的人被要求寫一本有連冠論點的書每一張單獨看還不錯但整本書的邏輯沒有冠通DataFlowHardness的研究團隊提出的解法師給AI提供更明確的數據流結構約束也就是先定義管道的股價再讓AI甜內容這樣可以把那個10.9分的差距縮小一部分對於再用AI搭建數據工作流的人來說這個發現很實用他告訴你一件事

10:01.441 --> 10:19.103
[SPEAKER_00]: 與其讓AI一次性生成整個管道不如把他拆成設計架構和實現各模塊兩個分開的部種你負責把握結構AI負責填充細節AI寫單個寒屬時特種兵AI設計整個系統是另一回事

10:19.764 --> 10:41.284
[SPEAKER_00]: 你可以回想一下过去,你让AI帮你做的最大规模的数据和贷马任务看看哪里出了问题?是不是恰好是在模块之间的连接点上?事实在下一个复杂任务里,先让AI写出整体的流程和接口定义在主部实现每一块,看看结果是否更稳定

10:41.904 --> 10:58.326
[SPEAKER_00]: MiraMurati的InklingSmall两周处于的锁小版这个节奏说明了什么这篇来自VentureBeat原文表题是ThinkingMachinesdebutsInklingSmallopensourceAImodelnearingperformanceofpredecessoratabout7Gsize

10:58.887 --> 11:18.972
[SPEAKER_00]: ThinkingMachines是Miramirati在離開OpenIG後創立的公司兩週前ThinkingMachines發布了Incling第一個開源多麼太遠模型這週他們發布了InclingSmoke參數兩月為原版的4分之一但性能接近原版速度這件事本身就是一個信號

11:19.752 --> 11:35.160
[SPEAKER_00]: 從一家新公司角度來看,兩週內出一個新能相當的縮橋板,以為這他們在模型壓縮和增流上有預先相好的路線,而不是零食印機。這符合Miramurati一貫的風格,不發學頭髮能跑的東西。

11:35.360 --> 12:02.304
[SPEAKER_00]: 从行业角度看,这个动作的意义在于四分之一大小接近同等性能这个组合对于大量在边缘设备本地部署或者成本敏感场景下使用AI的团队来说这是一个很现实的选择信号你不需要花四倍的算力就可以得到大概相同水平的结果同时英课令系列是开缘的这样他在商业比完模型之外开批了另一条路径

12:03.044 --> 12:26.250
[SPEAKER_00]: 你可以在自己的基礎设施上跑不依赖任何API也不存在数据离开本地的问题对于一些对数据隐私有要求的企业场景这是一个现实的考量点值得持续观察的是这家公司的迭代节奏和发布策略InclingSmoke是否是最好的模型是另一个问题

12:27.230 --> 12:56.683
[SPEAKER_00]: 在接下來一兩年裡,模型壓縮和效率提升,很可能比絕對性能的軍備競賽更影響實際部署決策。模型變小的速度,有時候比模型變強的速度更重要。你可以去HaginFace上找到FankingMachin's的InklingSmoke模型頁面,看看他支持的任務類型和推薦的硬件要求。如果你正在評估本地部署方案,可以把InklingSmoke加進你的候選列表,更快和Jama系列做一個很像比較。

12:57.023 --> 13:25.030
[SPEAKER_00]: 今天聊的几件事有一个影线穿在里面工具在变便宜能力在逼近边界而边界本身变得越来越可测量这不是坏事,这是成熟今天提到的所有原文练接都在节目的收贸此理保持好奇,我们明天继续按线您的收听有任何建议,一件请在X也就是推特上于Berry-Leonci本节目还会继续进化请保持期待

