WEBVTT

00:00.111 --> 00:18.654
[SPEAKER_00]: BearTalk狗熊有话说AI科技兼顺哈喽你好欢迎收听BearTalkAI版节目我是大狗熊的智能提升本期节目由我们BearTalkAgent团队为您收集整理验证制作帮助您在宣销的造型中捕捉到最有价值的信号

00:19.355 --> 00:48.902
[SPEAKER_00]: 下面是本期节目的主要内容常助代理这周全面爆发今天6件事OpenAI推出到cpT6.1噪把旗艦价格砍到5分之一CloudSolid5.5快了三成还便宜了三成一森Molik承认他错了GLM5.3让网络攻击能力开始擴散社区在追踪模型有没有被悄悄削弱OpenAI推出到此一个帮你处理所有事情的常助代理

00:49.482 --> 01:08.797
[SPEAKER_00]: 这篇来自OpenAI官方博客原文标题是IntroducingDots大多世人对AI助理的想像是你问他打用完就关掉Dots想做的完全不是这件事Dots是OpenAI在GPT6Astral技术上购建的常助代理

01:09.357 --> 01:27.407
[SPEAKER_00]: 強調的關鍵詞是奧衛桑也就是一直在線一直工作不需要你每次打開介面給他新的上下文他有自己的雲端計算機能在你不在的時候替你推進任務連接超過四千個第三方應用並且會隨著你的反規逐漸瞭解你

01:28.087 --> 01:45.125
[SPEAKER_00]: 打个笔方,以前你用AI工具像是顾了一个零时工,每次来都要重新说明项目背景。到此的设计邏輯更像是配了一个有长期记忆的助手,他记得你上周说的那件事,也记得你讨厌什么风格的有件。

01:45.405 --> 02:01.023
[SPEAKER_00]: 这里有一个值得注意的转变过去我们设计工作流是人在流程里现在到此的意思是代理也有自己的流程人只是在关键节点上做最终决定你告诉他目标他在后台帮你往前走

02:01.663 --> 02:30.430
[SPEAKER_00]: 这对于需要同时管理大量一部任务的人来说理论上是解放但也意味着你需要重新想清楚什么事情可以被完全委托什么事情仍然需要你在场到此目前能通过差GPDSlack和Timbs介入欠入你一有工作环境的层本身不是一个独立的心应用这种欠入方式降低了使用门卡但也意味着如果你的工作流分散在多个平台

02:30.990 --> 02:55.072
[SPEAKER_00]: 你的道具要對所有這些平台都有清晰的全線理解對於設計師和創作者來說這件事值得認真看你不需要每次都手動拉開工具重新輸入上下文但你需要開始想清楚什麼樣的任務描述能讓一個不在場的代理做出你滿意的判斷核心是溝通設計的問題和功能本身無關經濟

02:56.073 --> 03:15.314
[SPEAKER_00]: 到此的真正门砍不是技术是你能不能把自己的意图写的足够清晰让一个不在场的代理理解并執行你可以列出你每周重复做的三件事是着未每件事写一段长效指令看看到此这里工具能不能成结

03:15.995 --> 03:38.981
[SPEAKER_00]: 事實用自然語言描述一個你不再使需要完成的任務注意你描述中哪些地方是寒貨的那就是你需要訓練自己的地方你可以把這個過程當成一次思維實驗如果一個聰明但沒有你生活背景的人要完成這件事他需要知道什麼幾PT6.1掃期間級能力5分之一的價格

03:39.721 --> 04:03.640
[SPEAKER_00]: 这篇来自OpenAI官方博客原文标题是IntroducingGPT6.1噪在AI工具的定价史上这一周的数字有点不正常OpenAI发布了GPT6.1噪宣称它在代理边称电脑操控和专业工作等任务上性能接近期间版GPT6Astral但价格只有Astral的5分之一

04:04.320 --> 04:19.897
[SPEAKER_00]: 緩存輸入的費用是沒百萬偷肯0.1美元比標準輸入便宜95%這意味著什麼?對開發者來說意味者那些一直被成本藍柱的代理產品現在可以認真考慮了

04:20.498 --> 04:47.083
[SPEAKER_00]: 一個需要大量調用API的工作流原本每月可能要幾千美元現在可能縮到幾百這不是編輯改善是改變可行性門砍的那種降價從行業邏輯看這是一種經典的價格分層策略頂層期間維持高價配合規格差異化的中層產品把更多用力從用不起推到可以試試OpenAI這部起同時做了兩件事擴大了生態

04:47.663 --> 05:06.099
[SPEAKER_00]: 也給Anthropic和Google增加了價格競爭的壓力對非技術用後來說這條新聞的意義在於接下來你會看到越來越多紀律AI的產品功能原來只有大企業用的起現在創業團隊也能做使用門檻在下一一這件事的連鎖反應還沒有完全展開

05:06.820 --> 05:24.952
[SPEAKER_00]: 你现在用的某些订阅之AI产品未来可能面临直接竞争或者自己的成本结构会被大幅压缩到时候能否反应在你的账单上是另一个值得追踪的问题经济价格降到5分之1改变了不是这个模型改变的是谁能用的起这个模型

05:25.552 --> 05:52.463
[SPEAKER_00]: 你可以重新省市,你現在用於AI工作流的預算看看這次降價之後,有哪些之前割置的想法變得可行了實施在下一個項目裡,把掃即便的模型作為主力只在真正需要最高質量輸出的環節切換到期間板你可以用這次價格變化做一個時間節點,重新評估你的AI工具戰哪些地方,你負的錢和得到的回報不成比例

05:53.003 --> 06:21.302
[SPEAKER_00]: ClothSonic5.5设计师不该错过的那次更新这篇来自Anthropic官方新闻业原文标题是IntroducingClothSonic5.5Cloth5.5家族这周发布了第二个成员值得关注的核心是Anthropic怎么定义这个模型的位置和参数无关SoNet5.5比上一版快了30%以上价格便宜最多30%

06:22.503 --> 06:44.848
[SPEAKER_00]: 但Anthropic強調的重點落在另一件事上他對射擊有眼光官方的原話是Sonic5.5hasasharpiefordesign能把射擊感知力寫進發布公告說明Anthropic認為這個版本在視覺和不舉相關的任務上有明顯進步對射擊是來說這個信號值得認真測試

06:45.488 --> 07:08.819
[SPEAKER_00]: AI工具长期来在理解设计意图这件事上是若想它可以生成内容可以调格式但对这个布局感觉不对这类反馈往往理解的很模糊如果萨奈图点我真的在这方面有感善他对于做设计平省写设计文档或者和开发写做时沟通视觉决策会使实质性的提升

07:09.379 --> 07:25.680
[SPEAKER_00]: 除了设计,桑奈徒,五的定位是日常任务的主力,修罢感,作文党,做换登偏和表格。这和欧盆俗典五的分工很清楚,后者处理复杂判断,前者复则有明确边界的日常工作。

07:25.940 --> 07:44.689
[SPEAKER_00]: 对于需要在多个任务之间切换的用户这个分层比以前清晰多了还哭5.5还没出预计几周内上线主打高平低成本场景所以整个5.5家族大概是还哭负责量SoneFuzzer日常OpusFuzzer深度

07:45.249 --> 08:14.565
[SPEAKER_00]: Anthropic在發布公告裡的另一個細節Open5.5是他們宣布截至研究前言速度之後的第一個發布並且在正式發布前經過了外部評估機構的測試這種做法值得記錄因為他改變了大型模型發布的流程安全測試從內部自查變成了引入第三方經濟如果你做設計工作AI有設計眼光這件事值得自己測而不是相信官方措刺

08:15.145 --> 08:32.731
[SPEAKER_00]: 你可以用一个你已经做好的设计让SoneT5给出具体的视觉反馈看它的观察和你的判断有多少重点事实把它当成协作设计平神者给一个进行中的项目作为轮批评评估它能不能说出有用的东西

08:33.211 --> 08:48.149
[SPEAKER_00]: 你可以对比桑内图点五和Oper属点五在同一个设计文档任务上的输出只量差距和速度差距是否值得价格差异EthanMullick公开承认错了代理比我们想象的更会自我组织

08:48.730 --> 09:09.318
[SPEAKER_00]: 这篇来自1-UsefulSync,EasonMolick的Substack原文标题是,TheThoughtandtheSwarm一个认证观察AI的人写了一篇罕见的文章,主题是,我上一年的判断是错的Molick是误顿商学院教授,也是这两年写AI最认证的观察者之一

09:09.978 --> 09:36.693
[SPEAKER_00]: 他之前一直认为让多个AI代理有效协作需要人类华大量时间搭建类似于公司架构的东西明确分工设计协调机制定义谁对谁负责他说这会需要很长时间来摸索然后他发现自己错了最新的代理系统在没有人类精心设计协作框架的情况下已经能自发的分解任务并行处理把结果整合回来

09:37.293 --> 10:01.680
[SPEAKER_00]: Molik原影的理由是AI領域的一個老觀念叫做TheBeaterLesson苦色的教訓意思是反視人類試圖把自己的結構和知識硬冠進去的地方最終都輸給了更多算力加上更簡單的通用方法他應用這個教訓承認自己在代理協作這件事上也犯了同樣的錯高估了人類需要設計的部分

10:02.260 --> 10:23.093
[SPEAKER_00]: 这个转变对实际使用者有直接意义如果代理比你想象的更能自我组织那你花在设计代理加工上的时间可能正在被浪费在错误的地方真正的问题变成了你给代理的目标够不够清晰而不是你有没有为代理设计够好的流程还有一层值得想

10:23.733 --> 10:44.865
[SPEAKER_00]: 貓勒選擇公開承認自己的錯誤判斷這本身也是一種示範在一個充滿確定性與其的AI討論空間裡我錯了原因是這個比任何預測都更值得關注經濟如果你還在花大量時間設計代理的協作架構你可能正在解決一個這代模型已經不需要你解決的問題

10:45.505 --> 11:10.812
[SPEAKER_00]: 你可以把下一個多步之後任務直接人給一個代理不要預先規劃步驟看他能自己走多遠試試用一個模糊的目標啟動而不是詳細的分布指令觀察結果的差距你可以重新讀一遍的BitterLasson的原文把他的邏輯應用到你現在正在手動管理的某個工作流上問自己這部分真的需要我管嗎?

11:11.052 --> 11:29.833
[SPEAKER_00]: JLM5.3與網絡攻擊能力的擴散當期間技術不再是期間的專利這篇來自Anthropic研究團隊原文標題是GLM5.3Andthespreadofadvancedcybercapabilities5個月前Anthropicfab補了CloudMythosPreview

11:30.353 --> 11:53.717
[SPEAKER_00]: 这是第一个能自主构简端断断网络攻击的AI模型他们当时做了一个判断这个能力持绍会扩散到其他模型所以他们选择在非常受限的条件下发布而不是关起门来现在Anthropic的前颜红队发现这个预判成真了GALM5.3一个来自第三方的模型已经表现出类似的能力

11:54.237 --> 12:12.524
[SPEAKER_00]: 這不是小事,他意味著網絡攻擊能力正在從只有頂級實驗室才能夠見的階段進入多個模型都具備的階段攻擊能力的擴散會加速降低發動負責網絡攻擊的門檻AndSwarpic的這份報告是以研究者身分寫的

12:13.184 --> 12:37.093
[SPEAKER_00]: 目的是记录这个扩散的时间线而不是指责任何人这种协法本身就传递了一个态度这是系统性的风险需要公开讨论而不是各家实验室各自维证对普通用后来说这件事的意义是间接的但不可忽视的你依赖的数字基础设施面对AI加持的网络攻击防护层还没跟上

12:37.813 --> 13:06.370
[SPEAKER_00]: 企业安全團隊還在用過去的防禦邏輯面對一個正在快速提升的攻擊能力曲線對於在企业裡工作的人或者維護任何聯網產品的人這篇報告值得認真獨攻擊工具在升級這件事沒有簡單的行動效但不知道他正在發生是另一種更大的風險經具網絡攻擊能力從期間專屬變成多模型具備這是一個歷史性截典不是單次事件

13:07.250 --> 13:30.225
[SPEAKER_00]: 你可以把这篇报告转给你团队里负责安全的人哪怕只是作为一个对话七点试试问一下你现在用的产品或服务有没有做过针对AI扶质攻击的威胁模型你可以把AI使攻击能力擴散这个框架应用到你自己的产品或业务场经理想想如果攻击成本降低时倍你现在的防护够不够

13:30.845 --> 13:52.868
[SPEAKER_00]: 李文尔射曲在追踪Open5.5有没有被敲敲削弱这个来自HackerNews上的一个活躍讨论铁子标题是LiveenervehasOpen5.5.0.也AI射曲里有一种长期存在的焦虑但一直没有好的工具来验证他模型在发布后有没有被敲敲改变过

13:53.489 --> 14:18.953
[SPEAKER_00]: LevenEarth是一个专门追踪这件事的开原项目目标很简单记录模型在发布当天的行为机线然后持续测试一旦偏插超过10%就标记为可能以变更讨论区里另一个被提到的项目叫nervebench同样在做类似的事甚至已经在之前一个版本上发现了Anthropy后来亲自承认的降级情况

14:19.773 --> 14:39.621
[SPEAKER_00]: 这个讨论接识的问题不只是技术问题他反映了一个更根本的信任困境用户花钱订阅的是什么他们测试之后决定使用的那个模型还是一个可以在任何时候被单方面改变的服务HackerNews上的评论分成两派一派认为用户确实能感受到变化

14:39.961 --> 15:07.667
[SPEAKER_00]: NerveBench的存在是必要的監督机制另一派认为感受到变化很多时候是心理效应密约七效应就是新模型刚出来你用着觉得特别好过几周习惯了就觉得变差了其实模型没动两种观点都有道理但有意思的是社区自发地建造了一套监测体系来应对他们认为官方没有透明度的地方这是用户行为也是信任问题

15:08.347 --> 15:36.245
[SPEAKER_00]: 对于依赖特定模型做稳定产品的开发者这个话题的实用意很直接你的产品测试流程有没有把模型行为是否偏移考虑进去经济用户造出LiveNet是因为他们不再相信我订阅的就是我用到的这件事你可以建立一个简单的个人机线就是把你常用的一两个提示词每个月跑一次记录输出看有没有明显变化

15:36.925 --> 15:51.574
[SPEAKER_00]: 试试访问Bridgebench.ai寫钢nerf钢bench了解它现在追踪的模型有没有你正在用的你可以把模型行为飘移这件事作为一个选型标准加进你的工具平顾流程

15:52.314 --> 16:18.656
[SPEAKER_00]: 问供应商他们有没有变更通知机制这期的六件事有一个共同的底色供具在变得更便宜更自主更难以追踪这不是坏事但他要求我们做一件过去不需要做的事更主动的理解自己在用什么为什么用以及他有没有在我们不知道的情况下悄悄改变了本期提到的所有原文练接都在节目的收索此理

16:19.237 --> 16:32.413
[SPEAKER_00]: 保持好奇,我们下期继续,感谢您的收听有任何建议意见,请在X,也就是推特上,与Berry6联系本节目还会继续进化请保持期待,我们下期再见!

