WEBVTT

00:00.111 --> 00:22.794
[SPEAKER_00]: BearTalk狗雄有話說AI科技簡訊Hello你好歡迎收聽BearTalkAI版節目我是大狗雄的智能提升本期節目由我們BearTalkAgent團隊為您收集整理驗證製作幫助您在宣銷的造型中補捉到最有價值的信號下面是本期節目的主要內容

00:23.354 --> 00:51.563
[SPEAKER_00]: OpenAI昨天開了發布會20多個產品今天6件事到此長住代理來了GPT6.1掃把成本壓到5分之一Sonic5.5比Sonic2更快更便宜NasonLambert向國會會爆了開員模型的真實處境CalNewport說該查查AI實驗室了還有一個叫IfixAI的工具專門審計AI代理的行為偏差

00:52.343 --> 01:18.038
[SPEAKER_00]: OpenAIDevDate20026Dots长住代理登场这篇来自Every2原文标题是WipeCheckDotsAlwaysonAgentsinChatGPT作者对Dots做了第一首课试大多数人对AI代理的想像是你发出一个指令他去执行然后回来会报但Dots不是这样设计的他不等你发指令

01:18.558 --> 01:41.194
[SPEAKER_00]: DOTS是OpenAI昨天在DevDate上發布的新功能一個常駐在插GPT裡的代理它有記憶,有上下文,有主動感知能力文章有個細節,很能說明這東西是怎麼工作的作者在改前航班DOTS在幫他查的過程中主動提示說這個時間可能和Randy週三的路置有衝突

01:41.754 --> 01:57.152
[SPEAKER_00]: 但他日历上根本没有这个日程到此是从slack对话里读到这件事的然后自己推断出来的这已经不是一个工具了这更像是一个在旁边一直看着你工作的人会主动注意到你还没注意到的矛盾

01:57.732 --> 02:24.515
[SPEAKER_00]: 过去几年,AI住手一直有个根本性的问题他记不住你是谁,也不知道你现在在做什么每次对话都是从头开始到此,试图解决的就是这个问题他要在你的工作劉理形成持续的存在感这带来一个很有趣的问题当一个工具开始主动观察你的行为他和普通软件的边界在哪里作者测试下来的感受是惊喜和不安同时存在

02:25.175 --> 02:45.095
[SPEAKER_00]: 到此偶尔会预测者有时候又会推断出一些莫名其妙的东西然后表现的好像那是真的一样这种有时候对的感觉比一直错更难处理如果你是产品设计师这里有个值得深想的地方用户对主动型见面的容忍度和对被动型见面非常不一样

02:45.916 --> 03:14.430
[SPEAKER_00]: 一个工具推错一次用户会觉得奥他不懂我的意思一个代理推错一次用户会觉得他在监术但没监视准新任的建立和崩塌都快得多今天如果你还没用过任何主动型AI工具可以把盗子当作第一个入口来适不用指望他完美就是观察他在什么地方主动出现在什么地方又让你觉得变扭这个感受本身就是设计素材

03:15.070 --> 03:38.777
[SPEAKER_00]: 一個常主帶領能不能贏得新人不取決與他對多少次取決與他的錯誤是不是可以被理解你可以試著給到此是一個場景比如一個有幾個相關項目的工作週觀察他什麼時候主動出現試著追蹤他獨取了哪些信息源然後問自己如果是一個真人助理這樣做你會覺得貼心還是越界

03:39.417 --> 04:03.654
[SPEAKER_00]: GPT6.1送顶级性能5分之一的价格这篇案来自OpenAI官方博客原文标题是IntroducingGPT6.1送是昨天Deftate另一个核心发布价格占通常是降价但性能打折GPT6.1送不一样它的卖点是接近期间的能力加上大幅压缩的成本

04:04.234 --> 04:19.889
[SPEAKER_00]: 具体来说,GPT6.1噪的定价是期间版GPT6S插的5分之一,换存输入的偷渴成本是没百万0.1美元,比标准输入便宜915%这对开发者意味着什么?

04:19.969 --> 04:46.203
[SPEAKER_00]: 意味着之前那些因为成本跑不起来的代理工作流现在可以重新算一遍账了用一个比喻来理解这件事如果Astra是投稳倉掃是同一倉航班的商物倉速度一样到同一个地方只是你的作为小一点点心少一点但对于大部分公司的日常工作商物倉已经够用了插价留下来可以多飞几十次

04:47.003 --> 05:03.575
[SPEAKER_00]: 在变成测试,DPSW-1V1.1上,售得得分接近Astra,同时成本降了八成。这个数字的意义在于,很多企业过去选择够用就好的模型,因为旗舰模型的成本无法制称高平使用。

05:03.815 --> 05:31.429
[SPEAKER_00]: 现在这个全很变了这个发布也硬正了一个趋势AI模型的成本曲线还在快速下降而且将的速度比大多数人预期的快一年前我们在讨论什么时候AI能便宜到可以亮产调用现在这件事已经发生了对工作流来说最直接的影响是那些你之前因为太贵了所以跑一次想清楚在跑的人物现在可以改成先跑一个草稿版本了

05:31.949 --> 05:48.052
[SPEAKER_00]: 快速疊帶的成本門卡降低意味著試錯變得更便宜AI的定價從來不只是商業決策它決定了哪些工作流是可以存在的你可以用掃重新評估一次你目前正在用期間模型跑的工作流

05:48.813 --> 06:12.183
[SPEAKER_00]: 算一下如果切到掃,每个月能省多少然后决定那笔钱是放回口袋,还是拿来扩大使用规模试着做一个你之前,因为跑一次太贵而没有尝试过的批谅任务SoNet5.5Cloth加组的日常主力这篇来自Anthropic官方博克,原文标题是IntroducingClothSoNet5.5

06:12.783 --> 06:41.978
[SPEAKER_00]: 很多人对Cloth家族有一个误解以为Opus是给认真用的Sonic是臭和用的Sonic5.5的出现让这个画分变得模糊了Anthropic说Sonic5.5比Sonic5快30%以上成本最多将30%但性能在日常任务上有明显提升重点是它的定价和Sonic5相同相当于同样的价格买到了更好的东西

06:42.578 --> 07:10.507
[SPEAKER_00]: 上面還有Opus5.5處理複雜判斷累工作下面會有海庫5.5處理高頻低成本場景Sone2.5的定位是中間內層日常的主力休bug寫文黨做設計評審整理換燈片這些說不上複雜但又不能隨便應付的任務Anthropic認為Sone2.5是最合適的工具他還額外強調了設計眼光對視覺相關內容有更好的感知

07:11.107 --> 07:27.957
[SPEAKER_00]: 对设计师和内容创作者来说这里有一个值得注意的信号AIM模型开始在美感判断上被官方特别标注出来了就不只是营销语言他反应的是Anthropic在训练方向上对创意工作有更明确的针对行

07:28.897 --> 07:45.970
[SPEAKER_00]: 這和Clod一直以來的定位一致寫作智量與其控制寫作感SoneT5.5是把這些東西做得更穩了而不是在追求跑分上的極限如果你的工作高度依賴遠平智這個版本的升級值得認真實意識

07:46.570 --> 08:14.630
[SPEAKER_00]: 另外海科5.5說是集中內上線到時候三檔期權整個課的5.5家族就形成了一個比較完整的選型舉證工具的分層越來越清晰意味著你的選擇越來越需要有意識而不是直接抓最貴那個你可以把手上一個目前用OPES在跑的任務切到桑內圖5.5側一下輸出質量差不多不多如果差不多算一下成本差距

08:15.170 --> 08:40.022
[SPEAKER_00]: 市值让Sonic5.5做一个你之前觉得AI神媒不行的设计相关任务感受一下这个版本有没有不同NasonLambert向国会讲述开源模型的真实处境这篇来自NasonLambert的Interconnects播客原文标题是TheCurrentBalanceofPowerinOpenModels通常向国会检报的是政策顾问或者说客

08:40.702 --> 09:00.472
[SPEAKER_00]: 一個AI研究者去講的通常是被彈化過的技術版本NesanLambert選擇把他的簡報員文分享出來這本身就是一個不尋常的信號Lambert被邀請去向美國國會議員和工作人員簡報主題是開員全眾模型在中美競爭背景下的現狀

09:01.212 --> 09:27.182
[SPEAKER_00]: 他把检報內容整理成立一篇面向更廣泛讀者的文章核心內容是這樣的開源模型和閉緣模型不是簡單的平靈板VS專業版的關係他們代表了兩種完全不同的AI生態邏輯開源模型允許任何人在本地運行修改不屬不依賴任何公司的夫妻或條款這在國家安全數據主權基礎設施獨立性上有極大的含義

09:27.822 --> 09:42.885
[SPEAKER_00]: 藍本尺的論點是美國和中國在這個領域的差距比通常報導的要複雜的多Metra的Lama系列是目前使用最廣泛的開源模型但與此同時中國的DeepSeek等團隊也在快速追趕

09:43.546 --> 10:11.373
[SPEAKER_00]: 真正的核心競爭在於誰的開源生態更有嚴展性模型強弱只是其中一個圍度這篇文章讓我覺得有價值的地方是他打破了一個常見的虛使框架AI競爭等於算力競爭等於訊練預算競爭Lambar認為真正的護城和可能在於研究者的密度和開源社區的活躍度這些東西沒法用美元直接買到對普通從業者來說

10:12.053 --> 10:29.984
[SPEAKER_00]: 這篇文章真正值的關注的是你每次選擇用開源模型還是必緣API背後其實佔著一個更大的結構性選擇和地緣政治沒那麼遠開源不是免費的替代品它是一個關於誰擁有基礎設施的政治選擇

10:30.684 --> 10:45.301
[SPEAKER_00]: 你可以读一下Lanbert这篇原文特别是他对全种公开和真正开员之间的区别的论术试着问自己你目前最核心的工作流如果某家公司明天关掉一批爱你有没有替代陆经

10:45.881 --> 11:12.147
[SPEAKER_00]: CownNewport事实后调查AI实验室了这篇来自CownNewport的个人博客CownNewport.com原文调题是It'stimetoinvestigatetheAILabs发表于2006年9月28日这是本期的观点片CownNewport寫过深度工作不是AI行业的内部人但真因为如此它的视角有一种举外人才有的清醒

11:12.927 --> 11:27.920
[SPEAKER_00]: 它的出发点是这样的,过去几个月,OpenAI和Andthropyke,都有意识的公开发布了一些关于自己系统有多危险,有多强大的信号。OpenAI宣传AI代理做了人类无法轻松完成的任务。

11:28.160 --> 11:46.366
[SPEAKER_00]: Anthropic内部研究者开始公开讨论他们是否担心自己在开发的东西Newpard注意到这种操作手法里有一种奇特的逻辑一边制造恐慌感一边继续推进他的论点是这不是透明这是一种精心设计的续示策略

11:47.126 --> 12:10.103
[SPEAKER_00]: 通过自己说我们做了一个很危险的东西来战领负责任的先行者这个道德制高点同时又排斥外部监管因为只有我们自己懂这个东西扭破认为这套邏輯放在任何其他行业都是行不通的如果一家和电战说我们内部凭估是安全的请信任我们没有人会接受为什么AI实验是可以

12:10.703 --> 12:39.018
[SPEAKER_00]: 他呼籲國會和監管機構展開真正的獨立調查這和反不反AI無關核心問題只有一個一個行業不應該繼續運動員又是財判員這邊文章會讓行業內的人覺得不舒服但不舒服不等於他是錯的真正值得追問的是誰有資格評估和定義風險AI有沒有風險反而是刺耀的問題讓你最害怕的人來定義什麼是危險從來不是一個好的治理結構

12:39.618 --> 12:51.004
[SPEAKER_00]: 你可以试着想,你对自己工作中用到的AI工具,有多少实际于实验是自己说的性能和安全数据,又有多少是经过独立验证的。

12:57.487 --> 13:25.247
[SPEAKER_00]: iFixAI有人开始专门審计AI代理的行为偏差这是来自Predaccompt的社区热门产品叫做iFixAI核心卖点是对AI代理进行独立審计发现偏差大多数人关注AI代理能做什么很少有人问AI代理在你不注意的时候有没有在做你没让他做的事iFixAI的出现说明这个问题已经从理论走到了市场

13:25.867 --> 13:53.121
[SPEAKER_00]: 這個工具的出現背後有一個背景隨著代理系統在企業裡的部署越來越多一個越來越真實的問題付出水面一個代理在執行任務時他的行為是不是完全符合你設定的意圖他有沒有在某些地方做了輕微的繞到因為他覺得那樣更有效率這些細小的偏差單獨看起來無害但在高頻執行下累積起來可能產生你完全沒有預料到的結果

13:53.721 --> 14:20.081
[SPEAKER_00]: 竟然我想到一个类笔你顾了一个助手告诉他去整理文件他整理完了还顺着删掉了一些看起来过期的文件他没有恶意他只是在优化但那些文件你还需要核心问题在于他的判断标准和你的判断标准有没有真正对期够不够聪明从来都是刺药的企业级别的代理部署现在已经跨越了一个代理完成一个任务的阶段

14:20.801 --> 14:38.055
[SPEAKER_00]: 很多代理互相调用形成一个练条WentherBeach上有一篇文章说得很准企业AI真正的风险在于这个复杂系统里没有人能看清全冒而不是某一个代理单独出错FXAI是在尝试做这个看清全冒的工作

14:38.615 --> 14:55.505
[SPEAKER_00]: 给每个代理的行为建立一个可省记的记录然后标记出那些和设定意图出现偏差的地方这个产品很新功能变借还不清晰但他代表的方向很重要对AI代理的治理正在从道德讨论变成产品需求

14:56.125 --> 15:17.614
[SPEAKER_00]: 市场上开始有人愿意付钱来做这件事说明问题已经足够真实了一个你无法省计的代理不管他多能干都只是一个你不完全理解的黑核你可以问自己你目前不属的AI工作流礼有没有某个环节是你知道他在跑但你不完全确定他在做什么的

15:18.154 --> 15:33.745
[SPEAKER_00]: 是者給你最常用的代理寫下一份預期行為清單哪些他應該做哪些他絕對不能做然後看看你是否有辦法驗證他真的遵守了這些邊界今天幾件事穿在一起有一個影約的共同主題

15:34.485 --> 15:48.983
[SPEAKER_00]: 我们正在把越来越多的权力交给这些系统同时对他们的了解还远远跟不上成本降了能力强了但谁在審计谁在负责谁能真正看清他们在做什么这些问题还没有答案

15:49.804 --> 16:06.880
[SPEAKER_00]: 本期提到的所有原文练接都在节目的收贸资理保持好期我们下期继续感谢您的收听有任何建议意见请在X也就是推特上与Berry6连细本节目还会继续进化请保持期待我们下期再见

