WEBVTT

00:00.251 --> 00:24.442
[SPEAKER_00]: BearTalk狗熊有话说AI科技兼须哈喽您好欢迎收听BearTalkAI版节目我是大狗熊的智能提升本期节目由我们BearTalkAgent团队为您收集整理验证制作帮助您在宣销的造型中捕捉到最有价值的信号下面是本期节目的主要内容模型钻队了昨天一天三家同时发

00:25.202 --> 00:48.871
[SPEAKER_00]: 今天6件事,GEM93.7flash,降价5成煞進來,GPT5.6所速度快了14倍DipSick,除了個代理開發框架,有人把AI員工養在MacMini裡Hackersnews在討論AI正在吃掉互聯網的記憶,還有NathanLambert寫完了他的AI教材,然後開始懷疑AI什麼時候能寫得比他更好

00:49.391 --> 01:16.167
[SPEAKER_00]: Jamna3.7FlashGoogle在代理时代的价格战这篇来自Google官方博客原文标题是IntroducingJamna3.7FlashWancherBeat也做了详细的报道根进大多数让人看到Flash这个词会以为这只是个轻量级的补兵更新实际上Jamna3.7Flash是Google在代理工作流这个赛道上打出的一季很重的权

01:16.807 --> 01:43.972
[SPEAKER_00]: 首先说速度,这一代flash的定位是Coding和Agence的主力工作模型这两个词拆开来很重要Coding代表他要跟CloudCodeCursor背后的模型直接竞争Agence以为这Google认为这个模型在多步众长上下文的任务编排理是够用的以前flash给人的感觉是快,但粗糙这次Google在说,他不只是快,而是用来干活的

01:46.792 --> 02:11.156
[SPEAKER_00]: 發布同期,API價格直接打5折這個折口有Introductury的潛罪也就是說它是促銷期未來可能回升但在當下,它對開發者的意義是你可以用監難3.7F的價格換來一個比上一代更強的代理底座而且這是在監難3.6F推出僅僅三周之後三周,這讓我聯想到一件事

02:11.796 --> 02:37.024
[SPEAKER_00]: AI的发布节奏已经快到让版本后本身变得失去意义3.6-3.7放在以前的软件行业代表一个刺药更新但这里估计实在说这两个版本之间扣顶能力有实质性的越生这套命名体系要么在帮我们失去对模型迭代的感知要么本来就是为了让竞争对手在对比测评理失去参照点

02:37.604 --> 03:02.864
[SPEAKER_00]: 对工作流的实际影响是什么Flash系列在Google-ASDue和VirtXAI上都能用现在它是German-API里新加坛最高的选项如果你在大一个会跑很多轮调用的系统比如一个会减锁,会写,会合产,然后再写的代理管道Flash的成本优势会随调用刺书放大经济3周推1个版本

03:03.805 --> 03:22.191
[SPEAKER_00]: 是在說用我的理由還是在說別讓競爭對手有時間追測平這兩件事未必矛盾你可以在GoogleASDudio里直接是German3.7Flash看他在你最常跑的那個代理任務上的延遲和輸出質量是否滿足要求

03:22.731 --> 03:46.898
[SPEAKER_00]: 試試用它替換掉你現有管道理最貴的內層調用算一下實際成本差距如果你有vertexAI訪問全線可以跑一輪AB對比相同prompt3.6和3.7分別跑看輸出在哪些圍度上有變化GPT5.6收Ultrafast750個Token沒秒意味著什麼?

03:47.018 --> 04:06.023
[SPEAKER_00]: 这篇来自OpenAI官方博客原文标题是PreviewingUltraFastMode同期Ceribras也在自己的博客上发了联合公告你可能会想速度快14倍但我对速度又没特别高的要求这件事跟我有什么关系这里有个反直觉的地方

04:06.723 --> 04:35.308
[SPEAKER_00]: 速度本身不是目的速度解锁的是一类全新的交互方式当一个模型快到每秒输出750个头肯你和它的对话就从等待时交互变成了实实协作这个门砍一旦跨过很多原来不可能的用力就变得可能比如在用户敲子的同时让模型同步推理比如在带里執行任务实实实显示思考过程而不是等待一个最终结果这背后的技术合作值得单独说一下

04:35.888 --> 05:01.057
[SPEAKER_00]: OpenAI选择Ceribras作为AllTrafast的算力提供者而Ceribras是那家造了经元级别新片的公司他的新片架構跟英伟大的GPU有根本性的不同专门为低延迟推理设计这一位者OpenAI在供应练上做了分层他们记在跑英伟打也在跑Ceribras不同的工作负责走不同的硬件陆景

05:01.757 --> 05:17.091
[SPEAKER_00]: 这是一家在AI战理进行基础设施多元化的公司开始展现出来的样子目前Otrfast的只对部分API用户开放还在早期隐段但他透露的信号是速度会成为下一个被定价的维度

05:17.731 --> 05:39.785
[SPEAKER_00]: 现在AIAPI的定价主要看偷肯数量但未来的定价体系很可能是基础价格加速度一价就像快地分普通见和当日达AI推理也会变成想要快多复一点对设计师和创作者来说真正的影响可能在交互设计上当模型反映速度接近人类似好速度

05:40.485 --> 06:06.915
[SPEAKER_00]: 介面上的等待狀態設計就變成了多餘的負擔你今天設計的那個家在通話明天可能不再需要經濟速度快到一定程度就不再是速度而是一種新的存在感你可以申請AlcherFast的後補測試資格特別是如果你再做需要實施與銀或實施深成的產品想想你現在的產品裡有哪個用戶等待節點因為AI速度而存在

06:07.555 --> 06:29.604
[SPEAKER_00]: 如果这个等待被消除,交互流程会变成什么样。DeepSeekHardnessCloudCode遇到了开源对手。这篇来自DeepSeek官方博客和VentureBeat的报道。原文标题分别是DeepSeekHardnessDeveloperPreview和DeepSeekHardnessLaunchesasOpenSourceRivaltoCloudCode.

06:29.924 --> 06:50.327
[SPEAKER_00]: 大多数人知道DeepSeek是因为它的模型特别是V3和R1但这次DeepSeek做的是完全不同的一件事他进入了工具层Harness是一个代理开发框架开源原代马公开他的设计者学用一句话说完就是Everythingisaplugin

06:50.888 --> 07:09.687
[SPEAKER_00]: 每一个能力不管是模型选择工具调用会化管理还是刷箱环境都被抽象成可以独立替换的差件这跟ClaudeCode或者Cursor这类工具形成了直接的对比后者是封装好的产品你在里面工作但你不能把它拆开

07:10.267 --> 07:26.873
[SPEAKER_00]: Harness的目标用户是想自己搭代理流水线的开发者它给的是零件,不是成品同时发布的还有DeepSeekV4Pro的API版本这个模型专门针对代理工作复载优化但定价比V3要贵一些

07:27.693 --> 07:51.428
[SPEAKER_00]: 这里有个有趣的张力Harness是免费开源的但如果你想用DeepSeek自家最好的模型来跑它你还是要付API費用所以它是免费的框架配合可选的付费模型这是一个典型的开源变现邏輯对这个框架更值得关注的一点是它的时机CloudCode在过去几个月里建立了相当大的开发者认知度

07:52.228 --> 08:10.577
[SPEAKER_00]: 很多團隊已經開始為讓他搭工作流Harness出現意味著這個賽道的競爭從我的模型比你好升級到了我的開發工具生態比你好模型能力的差距可以被策評量化但工具生態的年輕一旦建立就很難被一個更好的模型打掉

08:11.237 --> 08:30.917
[SPEAKER_00]: 另一件值的关注的是DeepSeek同期发布的GLM5.3来自GPUAI继续同样的PostTraining扩展方法在Coding和网络安全任务上达到了接近前眼的水平中国的开放全重生态正在从单点突破转向系统性布局

08:31.517 --> 08:46.553
[SPEAKER_00]: 经济工具层的竞争不止是在争开发者是在争下一个时代的基础设施华语权你可以再给它不上找到DPC-Karnit的原代吗看看它的插件架构对你现在的代理项目有没有参考价值

08:47.093 --> 09:03.845
[SPEAKER_00]: 如果你在用ClaudeCode比较一下两个框架在多模型编排这件事上的设计私陆有什么不同把AI员工养在MacMini里拖地的一年这篇来自Av2原文标题是HowtosecureanAIinPoE

09:04.505 --> 09:25.595
[SPEAKER_00]: 大多数关于AI代理的文章在谈小项这篇在谈现实他讲的是Every2自己的资讯团队是怎么把一个叫Cloddy的ClodCode代理从一个项目管理工具养成了一个24小时运行的手袭助理Cloddy跑在一台专用的MacMini上

09:26.335 --> 09:43.300
[SPEAKER_00]: 團隊成員在斯拉克里跟他說話就像跟同時發消息他負責的事情包括整理會議紀錄跟進提案狀態更新十幾個GoogleShits的數據醫表盤這些都是一個小團隊最容易被運營所視顏目的節點

09:43.900 --> 10:06.146
[SPEAKER_00]: 但这篇文章真正值钱的部分是他们采了哪些坑文章利用了一个词叫SecuringandAIMPOI这个词本来在HR与经理意思是留住一个员工但在这里他同时包含另一层意思如何给代理画定边界让他不会做出超出售权的诗他们遇到的核心问题是全现漫严

10:06.846 --> 10:29.978
[SPEAKER_00]: 當代理的能力越來越強你給他的工具訪問全線也越來越多但你有沒有隨時知道他在用這些全線做什麼他們的解法是建立一套審批層級某些操作Cloddy可以自動完成某些操作需要人工在Slack裡確認還有些操作被明確列為禁止這是組織設計和技術方案無關

10:30.558 --> 10:54.343
[SPEAKER_00]: 这对任何在考虑我们团队要不要引入代理的人来说是最直接的参考材料代理不是工具他更像是一个需要被入职被培训被设定KPI然后被持续监督的新成员你以前花在管理人的时间会有一部分转移到管理代理上经济代理不难用难的是弄清楚什么东西你不该让他捧

10:54.863 --> 11:17.575
[SPEAKER_00]: 你可以试着列出你团队里重复出现频率最高的三类操作新任务判断哪一类有足够清晰的输入输出定义适合被代理接管在引入代理之前先写一份全现清单明确它能做什么需要确认才能做什么永远不要自己做什么AI正在吃掉互联网的集体记忆

11:18.175 --> 11:36.300
[SPEAKER_00]: 这篇来自TheWarriorsHackerNews上引发了大量讨论原文标题是GoogleSearchisdyingwhatcomesnextisworse先说一个具体的故事最近有人发现Google的AI拘藥开始给出错误的日落时间

11:37.260 --> 12:06.259
[SPEAKER_00]: 有用户因為新了這個時間在外面等著錯過了真正的日落這件事本身不大但他代表的問題很嚴重當AI專要替代了搜索結果用户失去了看到原始來源的機會他不知道這個信息來自哪不知道他是不是可信的不知道他是不是過失的文章提出的核心論點是搜索引擎過去的價值不只是幫你找信息更是為戶了一張指向原始信息的地圖

12:06.859 --> 12:31.140
[SPEAKER_00]: 每一條搜索結果都是一個鏈接一個去往某個具體來源的入口當這張地圖被AI加藥折疊成一個答案原始信息的可及性就下降了而原始信息得不到流量創作者就失去了生產原始信息的動力互聯網的集體記憶就開始為縮這不是微言總聽這是一個正在發生的反規循環

12:31.923 --> 12:56.287
[SPEAKER_00]: AI消費網頁內容來訓練但AI同時也在減少用戶訪問網頁的動力網頁因此減少AI下一輪能消費的內容就變少了這被一些研究者稱為互聯網的內報HackerNews的討論很有代表性有人說這是必然的搜索引擎本來就是在內容生產者和內容消費者之間差了一刀現在AI只是換了一把刀

12:56.887 --> 13:14.051
[SPEAKER_00]: 也有人说这是搜索SU内容农场的暴营那些靠对于关键词存活的垃圾内容里因被淘汰两边都有道理但两边都没有回答谁来保存真正值得保存的内容作为内容创作者这件事对你的影响是双虫的

13:14.611 --> 13:31.725
[SPEAKER_00]: 你的内容可能被用来训练AI但你的流量可能因为AI栽药而渏少这两件事同时在发生经济互联网的价值从来都不只是内容而是内容之间的练接当练接消失剩下的只是答案没有来龙区埋

13:32.325 --> 13:54.118
[SPEAKER_00]: 你可以检查一下你自己最常用的几个信息来源最近一个月有多少次是通过AI摘药得到答案然后停在那里没有点进原文试着建立一个习惯对你判断高价值的AI摘药主动追速一次原文NasonLambert写完了一本AI教材然后开始怀疑AI什么时候能超过它

13:54.738 --> 14:17.516
[SPEAKER_00]: 这篇来自InterConnect,NathenLambert的Substack原文表题是,IwroteanAItextbook好longuntilAIcandoitbetter这篇文章的角度很特别NathenLambert是做RLHF研究出身的他刚刚喜欢一本叫RingForcemanLearningfromHumanFeedback的技术教材

14:18.156 --> 14:36.430
[SPEAKER_00]: 这本书他写了好几年,在写的过程中一直在想一件事我现在在做的这件事,AI什么时候能比我做得更好他的答案出乎意料他认为对于像教材这类支持性写作AI的能力提升其实在让情况变得更糟

14:37.090 --> 15:05.335
[SPEAKER_00]: 核心问题在于AI越来越像一个把信息组织起来的机器但写得越来越不像一个在思考过程中让读者跟上的人好的教材不只是信息他是作者的一个思考轨迹是我当时是怎么被这个问题困住的然后我怎么想通的这个过程被RLA-F的訓練目标优化掉了因为它訓練的是用户满意度而不是认知上的挑战性

15:05.895 --> 15:32.862
[SPEAKER_00]: 這對任何在用AI輔助寫作的人都是以和值得警惕的提醒當你讓AI幫你欺操一篇文章他給你的往往時最被接受的表達方式而不是最能激發思考的表達方式這兩件事有時候一致但更多時候是矛盾的他也承認AI在某些寫作任務上確實更好整理參考文獻合查技術定義的準確性生存貸馬失利這些都是可以驗證輸出質量的任務

15:33.462 --> 16:02.815
[SPEAKER_00]: 但一旦进入你不知道答案是什么需要跟着作者一起摸索的领域AI就开始表现出一种奇怪的自信一种我知道答案的语气即使他并不确定这篇文章最后没有给出结论他在说我们可能正在训练出一批越来越像好学生的模型但越来越不像好老师经济AI能把所有事情说清楚但把事情说清楚和帮你把一件事真正想清楚是两件不同的事

16:03.395 --> 16:29.210
[SPEAKER_00]: 你可以试一个试验,把你最近写过的一篇文章,让AI改写成更流暢的版本,然后读一遍,看看有没有哪些地方,他把你的由于和摩索也顺带改掉了。那些被改掉的部分,往往是你思考,最有价值的地方。本期聊了三件在同一天发生的试,Google,OpenAI,DeepSeek,然后我们退后一步,看了三个更慢的问题。

16:29.470 --> 16:56.277
[SPEAKER_00]: AI代理怎么被安全的银入团队互联网的集体记忆是不是正在消失以及什么样的写作是AI真的做不到的本期提到的所有原文练界都在节目的收贺此理保持好奇我们下期继续感谢您的收听有任何建议意见请在X也就是推特上与BIR6联系本节目还会继续进化请保持期待我们下期再见

